olmo2-1b-decorr-c / midtrain_stats.json
joshycodes's picture
decorr midtrain
a98bacb verified
Raw
History Blame Contribute Delete
8.94 kB
{
"model": "allenai/OLMo-2-0425-1B-Instruct",
"corpus": "/root/mt/corpus_C.jsonl.gz",
"out": "/root/mt/out",
"seed": 17,
"block": 1024,
"bs": 16,
"grad_accum": 2,
"lr": 2e-05,
"max_steps": 1420,
"global_step": 1420,
"total_flos": 1.6442086038626304e+17,
"train_runtime_s": 696.0254,
"train_loss_mean": 1.6962001733376946,
"n_docs": 11356,
"dataset_tokens_post_truncation": 3343028,
"token_len_mean": 294.3842902430433,
"sequences_seen": 45440,
"epochs_equivalent": 4.001408946812258,
"trained_tokens_est": 13376822,
"note": "trained_tokens_est excludes padding; total_flos includes padding (collator pads to batch max) so it varies with doc lengths across corpora",
"log_history": [
{
"loss": 2.8222,
"grad_norm": 4.15625,
"learning_rate": 1.116279069767442e-05,
"epoch": 0.07042253521126761,
"step": 25
},
{
"loss": 2.2891,
"grad_norm": 2.265625,
"learning_rate": 1.999906309061717e-05,
"epoch": 0.14084507042253522,
"step": 50
},
{
"loss": 2.1255,
"grad_norm": 2.359375,
"learning_rate": 1.9974999757800105e-05,
"epoch": 0.2112676056338028,
"step": 75
},
{
"loss": 2.0548,
"grad_norm": 2.328125,
"learning_rate": 1.9918494468657112e-05,
"epoch": 0.28169014084507044,
"step": 100
},
{
"loss": 2.0386,
"grad_norm": 2.375,
"learning_rate": 1.982973099683902e-05,
"epoch": 0.352112676056338,
"step": 125
},
{
"loss": 1.9809,
"grad_norm": 2.328125,
"learning_rate": 1.970899803013991e-05,
"epoch": 0.4225352112676056,
"step": 150
},
{
"loss": 1.9327,
"grad_norm": 2.3125,
"learning_rate": 1.955668823159015e-05,
"epoch": 0.49295774647887325,
"step": 175
},
{
"loss": 1.9075,
"grad_norm": 2.34375,
"learning_rate": 1.9373296962387988e-05,
"epoch": 0.5633802816901409,
"step": 200
},
{
"loss": 1.9071,
"grad_norm": 2.171875,
"learning_rate": 1.915942067082319e-05,
"epoch": 0.6338028169014085,
"step": 225
},
{
"loss": 1.8791,
"grad_norm": 2.390625,
"learning_rate": 1.8915754952432456e-05,
"epoch": 0.704225352112676,
"step": 250
},
{
"loss": 1.8542,
"grad_norm": 2.40625,
"learning_rate": 1.8643092287695604e-05,
"epoch": 0.7746478873239436,
"step": 275
},
{
"loss": 1.8437,
"grad_norm": 2.375,
"learning_rate": 1.8342319464630258e-05,
"epoch": 0.8450704225352113,
"step": 300
},
{
"loss": 1.8306,
"grad_norm": 2.328125,
"learning_rate": 1.8014414694667685e-05,
"epoch": 0.9154929577464789,
"step": 325
},
{
"loss": 1.8437,
"grad_norm": 2.359375,
"learning_rate": 1.766044443118978e-05,
"epoch": 0.9859154929577465,
"step": 350
},
{
"loss": 1.7285,
"grad_norm": 2.484375,
"learning_rate": 1.7281559901074474e-05,
"epoch": 1.056338028169014,
"step": 375
},
{
"loss": 1.6873,
"grad_norm": 2.546875,
"learning_rate": 1.6878993360529985e-05,
"epoch": 1.1267605633802817,
"step": 400
},
{
"loss": 1.6908,
"grad_norm": 2.5,
"learning_rate": 1.6454054087395284e-05,
"epoch": 1.1971830985915493,
"step": 425
},
{
"loss": 1.6845,
"grad_norm": 2.515625,
"learning_rate": 1.6008124122941038e-05,
"epoch": 1.267605633802817,
"step": 450
},
{
"loss": 1.6805,
"grad_norm": 2.328125,
"learning_rate": 1.554265377702014e-05,
"epoch": 1.3380281690140845,
"step": 475
},
{
"loss": 1.6821,
"grad_norm": 2.359375,
"learning_rate": 1.5059156911186465e-05,
"epoch": 1.408450704225352,
"step": 500
},
{
"loss": 1.6664,
"grad_norm": 2.40625,
"learning_rate": 1.455920601512283e-05,
"epoch": 1.4788732394366197,
"step": 525
},
{
"loss": 1.684,
"grad_norm": 2.3125,
"learning_rate": 1.4044427092391031e-05,
"epoch": 1.5492957746478875,
"step": 550
},
{
"loss": 1.6615,
"grad_norm": 2.40625,
"learning_rate": 1.3516494372137368e-05,
"epoch": 1.619718309859155,
"step": 575
},
{
"loss": 1.667,
"grad_norm": 2.4375,
"learning_rate": 1.2977124863952753e-05,
"epoch": 1.6901408450704225,
"step": 600
},
{
"loss": 1.6239,
"grad_norm": 2.5625,
"learning_rate": 1.2428072773596875e-05,
"epoch": 1.76056338028169,
"step": 625
},
{
"loss": 1.6079,
"grad_norm": 2.453125,
"learning_rate": 1.1871123797748285e-05,
"epoch": 1.8309859154929577,
"step": 650
},
{
"loss": 1.6291,
"grad_norm": 2.546875,
"learning_rate": 1.1308089316335695e-05,
"epoch": 1.9014084507042255,
"step": 675
},
{
"loss": 1.625,
"grad_norm": 2.375,
"learning_rate": 1.0740800501339009e-05,
"epoch": 1.971830985915493,
"step": 700
},
{
"loss": 1.5886,
"grad_norm": 2.34375,
"learning_rate": 1.0171102361220093e-05,
"epoch": 2.0422535211267605,
"step": 725
},
{
"loss": 1.5726,
"grad_norm": 2.53125,
"learning_rate": 9.600847740352834e-06,
"epoch": 2.112676056338028,
"step": 750
},
{
"loss": 1.5689,
"grad_norm": 2.375,
"learning_rate": 9.03189129296821e-06,
"epoch": 2.183098591549296,
"step": 775
},
{
"loss": 1.564,
"grad_norm": 2.59375,
"learning_rate": 8.466083451213145e-06,
"epoch": 2.2535211267605635,
"step": 800
},
{
"loss": 1.5592,
"grad_norm": 2.375,
"learning_rate": 7.90526440694096e-06,
"epoch": 2.323943661971831,
"step": 825
},
{
"loss": 1.5616,
"grad_norm": 2.328125,
"learning_rate": 7.351258126806556e-06,
"epoch": 2.3943661971830985,
"step": 850
},
{
"loss": 1.5456,
"grad_norm": 2.515625,
"learning_rate": 6.80586642013133e-06,
"epoch": 2.464788732394366,
"step": 875
},
{
"loss": 1.5657,
"grad_norm": 2.546875,
"learning_rate": 6.2708630788308754e-06,
"epoch": 2.535211267605634,
"step": 900
},
{
"loss": 1.5398,
"grad_norm": 2.625,
"learning_rate": 5.747988108464501e-06,
"epoch": 2.6056338028169015,
"step": 925
},
{
"loss": 1.5779,
"grad_norm": 2.40625,
"learning_rate": 5.238942069169e-06,
"epoch": 2.676056338028169,
"step": 950
},
{
"loss": 1.566,
"grad_norm": 2.40625,
"learning_rate": 4.745380544881779e-06,
"epoch": 2.7464788732394365,
"step": 975
},
{
"loss": 1.5517,
"grad_norm": 2.34375,
"learning_rate": 4.268908758841318e-06,
"epoch": 2.816901408450704,
"step": 1000
},
{
"loss": 1.544,
"grad_norm": 2.5625,
"learning_rate": 3.8110763528770543e-06,
"epoch": 2.887323943661972,
"step": 1025
},
{
"loss": 1.5717,
"grad_norm": 2.546875,
"learning_rate": 3.373372347468141e-06,
"epoch": 2.9577464788732395,
"step": 1050
},
{
"loss": 1.5512,
"grad_norm": 2.5,
"learning_rate": 2.9572202989626406e-06,
"epoch": 3.028169014084507,
"step": 1075
},
{
"loss": 1.5375,
"grad_norm": 2.4375,
"learning_rate": 2.5639736697074525e-06,
"epoch": 3.0985915492957745,
"step": 1100
},
{
"loss": 1.545,
"grad_norm": 2.390625,
"learning_rate": 2.1949114261468307e-06,
"epoch": 3.169014084507042,
"step": 1125
},
{
"loss": 1.5284,
"grad_norm": 2.515625,
"learning_rate": 1.8512338792058749e-06,
"epoch": 3.23943661971831,
"step": 1150
},
{
"loss": 1.5388,
"grad_norm": 2.484375,
"learning_rate": 1.5340587804874662e-06,
"epoch": 3.3098591549295775,
"step": 1175
},
{
"loss": 1.5482,
"grad_norm": 2.484375,
"learning_rate": 1.2444176869790925e-06,
"epoch": 3.380281690140845,
"step": 1200
},
{
"loss": 1.562,
"grad_norm": 2.546875,
"learning_rate": 9.83252606092675e-07,
"epoch": 3.4507042253521125,
"step": 1225
},
{
"loss": 1.5496,
"grad_norm": 2.453125,
"learning_rate": 7.514129319488839e-07,
"epoch": 3.52112676056338,
"step": 1250
},
{
"loss": 1.5414,
"grad_norm": 2.5,
"learning_rate": 5.496526828701076e-07,
"epoch": 3.591549295774648,
"step": 1275
},
{
"loss": 1.554,
"grad_norm": 2.578125,
"learning_rate": 3.786280490666605e-07,
"epoch": 3.6619718309859155,
"step": 1300
},
{
"loss": 1.5301,
"grad_norm": 2.5625,
"learning_rate": 2.3889525849194573e-07,
"epoch": 3.732394366197183,
"step": 1325
},
{
"loss": 1.5406,
"grad_norm": 2.359375,
"learning_rate": 1.3090876780753715e-07,
"epoch": 3.802816901408451,
"step": 1350
},
{
"loss": 1.5475,
"grad_norm": 2.46875,
"learning_rate": 5.501978434171884e-08,
"epoch": 3.873239436619718,
"step": 1375
},
{
"loss": 1.5372,
"grad_norm": 2.53125,
"learning_rate": 1.147512384857663e-08,
"epoch": 3.943661971830986,
"step": 1400
},
{
"train_runtime": 696.0254,
"train_samples_per_second": 65.285,
"train_steps_per_second": 2.04,
"total_flos": 1.6442086038626304e+17,
"train_loss": 1.6962001733376946,
"epoch": 4.0,
"step": 1420
}
]
}