TimeCapsuleLLM-ja-v0 / training_report.json
trtd56's picture
Release phase1 staging
f58d80a verified
Raw
History Blame Contribute Delete
4.02 kB
{
"iterations": 3200,
"parameter_count": 29630976,
"tokens_per_step": 65536,
"processed_tokens": 209715200,
"elapsed_seconds": 1039.6968399565667,
"best_validation_loss": 4.693336009979248,
"history": [
{
"iteration": 200,
"train_loss": 6.874281406402588,
"validation_loss": 6.851297378540039,
"learning_rate": 0.0005986422613134286,
"elapsed_seconds": 63.88019962795079
},
{
"iteration": 400,
"train_loss": 5.891294479370117,
"validation_loss": 5.937683582305908,
"learning_rate": 0.0005876993794374133,
"elapsed_seconds": 128.35756858997047
},
{
"iteration": 600,
"train_loss": 5.376547813415527,
"validation_loss": 5.505178451538086,
"learning_rate": 0.0005662062546888388,
"elapsed_seconds": 192.76678066514432
},
{
"iteration": 800,
"train_loss": 5.047382354736328,
"validation_loss": 5.2386860847473145,
"learning_rate": 0.0005350428181202468,
"elapsed_seconds": 257.3545547667891
},
{
"iteration": 1000,
"train_loss": 4.829380989074707,
"validation_loss": 5.086492538452148,
"learning_rate": 0.0004954849044863036,
"elapsed_seconds": 321.76191609352827
},
{
"iteration": 1200,
"train_loss": 4.650263786315918,
"validation_loss": 4.960005283355713,
"learning_rate": 0.0004491520194190405,
"elapsed_seconds": 386.7139264252037
},
{
"iteration": 1400,
"train_loss": 4.50961446762085,
"validation_loss": 4.872649669647217,
"learning_rate": 0.0003979410366769941,
"elapsed_seconds": 451.70882767252624
},
{
"iteration": 1600,
"train_loss": 4.388186931610107,
"validation_loss": 4.814062118530273,
"learning_rate": 0.0003439485399106587,
"elapsed_seconds": 516.5635145176202
},
{
"iteration": 1800,
"train_loss": 4.287715435028076,
"validation_loss": 4.772805690765381,
"learning_rate": 0.00028938498828149706,
"elapsed_seconds": 581.7271312791854
},
{
"iteration": 2000,
"train_loss": 4.204434871673584,
"validation_loss": 4.740018844604492,
"learning_rate": 0.00023648422000415223,
"elapsed_seconds": 646.7632373739034
},
{
"iteration": 2200,
"train_loss": 4.136469841003418,
"validation_loss": 4.717632293701172,
"learning_rate": 0.0001874119987474749,
"elapsed_seconds": 711.0149517673999
},
{
"iteration": 2400,
"train_loss": 4.068326473236084,
"validation_loss": 4.712490558624268,
"learning_rate": 0.0001441773470154548,
"elapsed_seconds": 776.0104932170361
},
{
"iteration": 2600,
"train_loss": 4.019182205200195,
"validation_loss": 4.69955587387085,
"learning_rate": 0.00010855029652985661,
"elapsed_seconds": 841.718034747988
},
{
"iteration": 2800,
"train_loss": 3.980391263961792,
"validation_loss": 4.69523811340332,
"learning_rate": 8.198942292356145e-05,
"elapsed_seconds": 907.1116172447801
},
{
"iteration": 3000,
"train_loss": 3.948561191558838,
"validation_loss": 4.693336009979248,
"learning_rate": 6.558213148278118e-05,
"elapsed_seconds": 971.7278313729912
},
{
"iteration": 3200,
"train_loss": 3.918356418609619,
"validation_loss": 4.693871021270752,
"learning_rate": 6.0000138646876194e-05,
"elapsed_seconds": 1036.9277061484754
}
],
"environment": {
"python": "3.11.10",
"platform": "Linux-5.15.0-107-generic-x86_64-with-glibc2.35",
"torch": "2.5.1+cu124",
"cuda": "12.4",
"gpu": "NVIDIA RTX A5000"
},
"data_manifest_sha256": "41a2e024d3c6b7f575e70a291cdb12e131c7ecb6dd2cf0c56491f2789ce7ca77",
"peak_vram_bytes": 2612344832,
"gpu_total_bytes": 25293946880,
"gpu_hourly_usd": 0.27,
"estimated_training_cost_usd": 0.0779772629967425
}