TimeCapsuleLLM-ja-v1-small / training_report.json
trtd56's picture
Release phase2 staging
58e0fa2 verified
Raw
History Blame Contribute Delete
8.07 kB
{
"iterations": 2400,
"parameter_count": 120349440,
"tokens_per_step": 131072,
"processed_tokens": 314572800,
"elapsed_seconds": 5886.268626770005,
"best_validation_loss": 5.134598255157471,
"history": [
{
"iteration": 100,
"train_loss": 7.84290885925293,
"validation_loss": 7.806333065032959,
"learning_rate": 0.0005939999999999999,
"elapsed_seconds": 236.28617264330387,
"projected_total_hours": 0.3281752397823665,
"projected_total_cost_usd": 0.08860731474123897
},
{
"iteration": 200,
"train_loss": 7.040276050567627,
"validation_loss": 7.100771427154541,
"learning_rate": 0.0005942168441678774,
"elapsed_seconds": 480.88143431581557,
"projected_total_hours": 0.3339454404970941,
"projected_total_cost_usd": 0.09016526893421542
},
{
"iteration": 300,
"train_loss": 6.685205459594727,
"validation_loss": 6.788591384887695,
"learning_rate": 0.0005768867365685819,
"elapsed_seconds": 727.3782979361713,
"projected_total_hours": 0.3367492120074867,
"projected_total_cost_usd": 0.09092228724202142
},
{
"iteration": 400,
"train_loss": 6.431410312652588,
"validation_loss": 6.551764011383057,
"learning_rate": 0.0005487664938872375,
"elapsed_seconds": 971.8389842156321,
"projected_total_hours": 0.33744409174153894,
"projected_total_cost_usd": 0.09110990477021552
},
{
"iteration": 500,
"train_loss": 6.205532073974609,
"validation_loss": 6.343863487243652,
"learning_rate": 0.0005110851056649143,
"elapsed_seconds": 1216.9689059387892,
"projected_total_hours": 0.3380469183163303,
"projected_total_cost_usd": 0.0912726679454092
},
{
"iteration": 600,
"train_loss": 6.005918979644775,
"validation_loss": 6.159409046173096,
"learning_rate": 0.0004654894293822898,
"elapsed_seconds": 1464.3989623263478,
"projected_total_hours": 1.084739972093591,
"projected_total_cost_usd": 0.29287979246526963
},
{
"iteration": 700,
"train_loss": 5.821047306060791,
"validation_loss": 5.991540431976318,
"learning_rate": 0.000413972214885244,
"elapsed_seconds": 1711.4358539339155,
"projected_total_hours": 1.0866259390056607,
"projected_total_cost_usd": 0.2933890035315284
},
{
"iteration": 800,
"train_loss": 5.646799087524414,
"validation_loss": 5.839986801147461,
"learning_rate": 0.0003587850116543201,
"elapsed_seconds": 1958.1738921981305,
"projected_total_hours": 1.087874384554517,
"projected_total_cost_usd": 0.2937260838297196
},
{
"iteration": 900,
"train_loss": 5.511969566345215,
"validation_loss": 5.7192158699035645,
"learning_rate": 0.0003023397652882918,
"elapsed_seconds": 2205.4278924595565,
"projected_total_hours": 1.0891001938071883,
"projected_total_cost_usd": 0.2940570523279408
},
{
"iteration": 1000,
"train_loss": 5.387481689453125,
"validation_loss": 5.612607479095459,
"learning_rate": 0.00024710340390769715,
"elapsed_seconds": 2451.299042198807,
"projected_total_hours": 1.0894662409772475,
"projected_total_cost_usd": 0.29415588506385687
},
{
"iteration": 1100,
"train_loss": 5.2906174659729,
"validation_loss": 5.521340847015381,
"learning_rate": 0.00019549002155833746,
"elapsed_seconds": 2694.78519503586,
"projected_total_hours": 1.0888020990043878,
"projected_total_cost_usd": 0.2939765667311847
},
{
"iteration": 1200,
"train_loss": 5.1990485191345215,
"validation_loss": 5.441063404083252,
"learning_rate": 0.00014975537071736653,
"elapsed_seconds": 2938.766986746341,
"projected_total_hours": 1.0884322173134595,
"projected_total_cost_usd": 0.29387669867463406
},
{
"iteration": 1300,
"train_loss": 5.1335320472717285,
"validation_loss": 5.377827167510986,
"learning_rate": 0.00011189827508573826,
"elapsed_seconds": 3183.2163684107363,
"projected_total_hours": 1.0882791003113628,
"projected_total_cost_usd": 0.293835357084068
},
{
"iteration": 1400,
"train_loss": 5.080015182495117,
"validation_loss": 5.331523895263672,
"learning_rate": 8.357327140105425e-05,
"elapsed_seconds": 3428.121685290709,
"projected_total_hours": 1.088292598504987,
"projected_total_cost_usd": 0.2938390015963465
},
{
"iteration": 1500,
"train_loss": 5.044103622436523,
"validation_loss": 5.2975358963012695,
"learning_rate": 6.601829824278278e-05,
"elapsed_seconds": 3671.2561981901526,
"projected_total_hours": 1.0877796142785638,
"projected_total_cost_usd": 0.29370049585521224
},
{
"iteration": 1600,
"train_loss": 5.01863956451416,
"validation_loss": 5.270280361175537,
"learning_rate": 6.0000592176047586e-05,
"elapsed_seconds": 3915.9751346502453,
"projected_total_hours": 1.0877708707361793,
"projected_total_cost_usd": 0.2936981350987684
},
{
"iteration": 1700,
"train_loss": 4.996570587158203,
"validation_loss": 5.251531600952148,
"learning_rate": 6e-05,
"elapsed_seconds": 4161.210727300495,
"projected_total_hours": 1.63184734403941,
"projected_total_cost_usd": 0.4405987828906407
},
{
"iteration": 1800,
"train_loss": 4.976433277130127,
"validation_loss": 5.230465888977051,
"learning_rate": 6e-05,
"elapsed_seconds": 4407.253906426951,
"projected_total_hours": 1.6323162616396116,
"projected_total_cost_usd": 0.44072539064269517
},
{
"iteration": 1900,
"train_loss": 4.959025859832764,
"validation_loss": 5.213982105255127,
"learning_rate": 6e-05,
"elapsed_seconds": 4654.531830655411,
"projected_total_hours": 1.6331690633878635,
"projected_total_cost_usd": 0.4409556471147232
},
{
"iteration": 2000,
"train_loss": 4.941042900085449,
"validation_loss": 5.198922157287598,
"learning_rate": 6e-05,
"elapsed_seconds": 4899.879536379129,
"projected_total_hours": 1.633293178793043,
"projected_total_cost_usd": 0.4409891582741216
},
{
"iteration": 2100,
"train_loss": 4.923161506652832,
"validation_loss": 5.181520462036133,
"learning_rate": 6e-05,
"elapsed_seconds": 5145.104391111061,
"projected_total_hours": 1.6333664733685909,
"projected_total_cost_usd": 0.44100894780951955
},
{
"iteration": 2200,
"train_loss": 4.907833099365234,
"validation_loss": 5.165126323699951,
"learning_rate": 6e-05,
"elapsed_seconds": 5389.233639188111,
"projected_total_hours": 1.6331011027842761,
"projected_total_cost_usd": 0.44093729775175455
},
{
"iteration": 2300,
"train_loss": 4.896564483642578,
"validation_loss": 5.152801513671875,
"learning_rate": 6e-05,
"elapsed_seconds": 5632.714369047433,
"projected_total_hours": 1.632670831607952,
"projected_total_cost_usd": 0.44082112453414707
},
{
"iteration": 2400,
"train_loss": 4.876748561859131,
"validation_loss": 5.134598255157471,
"learning_rate": 6e-05,
"elapsed_seconds": 5877.340094184503,
"projected_total_hours": 1.6325944706068063,
"projected_total_cost_usd": 0.4408005070638377
}
],
"environment": {
"python": "3.11.10",
"platform": "Linux-5.15.0-107-generic-x86_64-with-glibc2.35",
"torch": "2.5.1+cu124",
"cuda": "12.4",
"gpu": "NVIDIA RTX A5000"
},
"data_manifest_sha256": "f492224f8bc7083fdac3c15ed348b5b0f627436a5e26c4fff109b3a6fe3f06de",
"peak_vram_bytes": 4921769984,
"gpu_total_bytes": 25293946880,
"estimated_training_cost_usd": 0.4414701470077504
}