olmo2-1b-decorr-p / midtrain_stats.json
joshycodes's picture
decorr midtrain
582503e verified
Raw
History Blame Contribute Delete
8.95 kB
{
"model": "allenai/OLMo-2-0425-1B-Instruct",
"corpus": "/root/mt/corpus_P.jsonl.gz",
"out": "/root/mt/out",
"seed": 17,
"block": 1024,
"bs": 16,
"grad_accum": 2,
"lr": 2e-05,
"max_steps": 1420,
"global_step": 1420,
"total_flos": 1.6059173098881024e+17,
"train_runtime_s": 681.2697,
"train_loss_mean": 1.16697087355063,
"n_docs": 11356,
"dataset_tokens_post_truncation": 2997357,
"token_len_mean": 263.94478689679465,
"sequences_seen": 45440,
"epochs_equivalent": 4.001408946812258,
"trained_tokens_est": 11993651,
"note": "trained_tokens_est excludes padding; total_flos includes padding (collator pads to batch max) so it varies with doc lengths across corpora",
"log_history": [
{
"loss": 2.6253,
"grad_norm": 4.03125,
"learning_rate": 1.116279069767442e-05,
"epoch": 0.07042253521126761,
"step": 25
},
{
"loss": 2.1348,
"grad_norm": 2.421875,
"learning_rate": 1.999906309061717e-05,
"epoch": 0.14084507042253522,
"step": 50
},
{
"loss": 1.9344,
"grad_norm": 2.484375,
"learning_rate": 1.9974999757800105e-05,
"epoch": 0.2112676056338028,
"step": 75
},
{
"loss": 1.8385,
"grad_norm": 2.734375,
"learning_rate": 1.9918494468657112e-05,
"epoch": 0.28169014084507044,
"step": 100
},
{
"loss": 1.7825,
"grad_norm": 2.5,
"learning_rate": 1.982973099683902e-05,
"epoch": 0.352112676056338,
"step": 125
},
{
"loss": 1.7067,
"grad_norm": 2.578125,
"learning_rate": 1.970899803013991e-05,
"epoch": 0.4225352112676056,
"step": 150
},
{
"loss": 1.6629,
"grad_norm": 2.75,
"learning_rate": 1.955668823159015e-05,
"epoch": 0.49295774647887325,
"step": 175
},
{
"loss": 1.6273,
"grad_norm": 2.59375,
"learning_rate": 1.9373296962387988e-05,
"epoch": 0.5633802816901409,
"step": 200
},
{
"loss": 1.5795,
"grad_norm": 2.734375,
"learning_rate": 1.915942067082319e-05,
"epoch": 0.6338028169014085,
"step": 225
},
{
"loss": 1.5083,
"grad_norm": 2.828125,
"learning_rate": 1.8915754952432456e-05,
"epoch": 0.704225352112676,
"step": 250
},
{
"loss": 1.4863,
"grad_norm": 2.6875,
"learning_rate": 1.8643092287695604e-05,
"epoch": 0.7746478873239436,
"step": 275
},
{
"loss": 1.4094,
"grad_norm": 3.078125,
"learning_rate": 1.8342319464630258e-05,
"epoch": 0.8450704225352113,
"step": 300
},
{
"loss": 1.4491,
"grad_norm": 3.0625,
"learning_rate": 1.8014414694667685e-05,
"epoch": 0.9154929577464789,
"step": 325
},
{
"loss": 1.377,
"grad_norm": 2.78125,
"learning_rate": 1.766044443118978e-05,
"epoch": 0.9859154929577465,
"step": 350
},
{
"loss": 1.2608,
"grad_norm": 2.71875,
"learning_rate": 1.7281559901074474e-05,
"epoch": 1.056338028169014,
"step": 375
},
{
"loss": 1.2003,
"grad_norm": 2.953125,
"learning_rate": 1.6878993360529985e-05,
"epoch": 1.1267605633802817,
"step": 400
},
{
"loss": 1.1853,
"grad_norm": 2.9375,
"learning_rate": 1.6454054087395284e-05,
"epoch": 1.1971830985915493,
"step": 425
},
{
"loss": 1.1655,
"grad_norm": 2.84375,
"learning_rate": 1.6008124122941038e-05,
"epoch": 1.267605633802817,
"step": 450
},
{
"loss": 1.1511,
"grad_norm": 3.0,
"learning_rate": 1.554265377702014e-05,
"epoch": 1.3380281690140845,
"step": 475
},
{
"loss": 1.1072,
"grad_norm": 2.953125,
"learning_rate": 1.5059156911186465e-05,
"epoch": 1.408450704225352,
"step": 500
},
{
"loss": 1.1113,
"grad_norm": 2.84375,
"learning_rate": 1.455920601512283e-05,
"epoch": 1.4788732394366197,
"step": 525
},
{
"loss": 1.082,
"grad_norm": 3.109375,
"learning_rate": 1.4044427092391031e-05,
"epoch": 1.5492957746478875,
"step": 550
},
{
"loss": 1.0855,
"grad_norm": 2.859375,
"learning_rate": 1.3516494372137368e-05,
"epoch": 1.619718309859155,
"step": 575
},
{
"loss": 1.079,
"grad_norm": 2.9375,
"learning_rate": 1.2977124863952753e-05,
"epoch": 1.6901408450704225,
"step": 600
},
{
"loss": 1.044,
"grad_norm": 3.015625,
"learning_rate": 1.2428072773596875e-05,
"epoch": 1.76056338028169,
"step": 625
},
{
"loss": 1.0273,
"grad_norm": 3.03125,
"learning_rate": 1.1871123797748285e-05,
"epoch": 1.8309859154929577,
"step": 650
},
{
"loss": 1.0425,
"grad_norm": 4.09375,
"learning_rate": 1.1308089316335695e-05,
"epoch": 1.9014084507042255,
"step": 675
},
{
"loss": 1.053,
"grad_norm": 4.09375,
"learning_rate": 1.0740800501339009e-05,
"epoch": 1.971830985915493,
"step": 700
},
{
"loss": 0.9627,
"grad_norm": 2.953125,
"learning_rate": 1.0171102361220093e-05,
"epoch": 2.0422535211267605,
"step": 725
},
{
"loss": 0.9782,
"grad_norm": 2.828125,
"learning_rate": 9.600847740352834e-06,
"epoch": 2.112676056338028,
"step": 750
},
{
"loss": 0.9538,
"grad_norm": 3.171875,
"learning_rate": 9.03189129296821e-06,
"epoch": 2.183098591549296,
"step": 775
},
{
"loss": 0.9441,
"grad_norm": 3.15625,
"learning_rate": 8.466083451213145e-06,
"epoch": 2.2535211267605635,
"step": 800
},
{
"loss": 0.9244,
"grad_norm": 3.0625,
"learning_rate": 7.90526440694096e-06,
"epoch": 2.323943661971831,
"step": 825
},
{
"loss": 0.9299,
"grad_norm": 2.703125,
"learning_rate": 7.351258126806556e-06,
"epoch": 2.3943661971830985,
"step": 850
},
{
"loss": 0.9352,
"grad_norm": 3.140625,
"learning_rate": 6.80586642013133e-06,
"epoch": 2.464788732394366,
"step": 875
},
{
"loss": 0.9047,
"grad_norm": 2.96875,
"learning_rate": 6.2708630788308754e-06,
"epoch": 2.535211267605634,
"step": 900
},
{
"loss": 0.9426,
"grad_norm": 3.09375,
"learning_rate": 5.747988108464501e-06,
"epoch": 2.6056338028169015,
"step": 925
},
{
"loss": 0.9042,
"grad_norm": 3.046875,
"learning_rate": 5.238942069169e-06,
"epoch": 2.676056338028169,
"step": 950
},
{
"loss": 0.9114,
"grad_norm": 3.328125,
"learning_rate": 4.745380544881779e-06,
"epoch": 2.7464788732394365,
"step": 975
},
{
"loss": 0.9239,
"grad_norm": 2.9375,
"learning_rate": 4.268908758841318e-06,
"epoch": 2.816901408450704,
"step": 1000
},
{
"loss": 0.9475,
"grad_norm": 2.84375,
"learning_rate": 3.8110763528770543e-06,
"epoch": 2.887323943661972,
"step": 1025
},
{
"loss": 0.9581,
"grad_norm": 3.171875,
"learning_rate": 3.373372347468141e-06,
"epoch": 2.9577464788732395,
"step": 1050
},
{
"loss": 0.9218,
"grad_norm": 2.90625,
"learning_rate": 2.9572202989626406e-06,
"epoch": 3.028169014084507,
"step": 1075
},
{
"loss": 0.8969,
"grad_norm": 2.6875,
"learning_rate": 2.5639736697074525e-06,
"epoch": 3.0985915492957745,
"step": 1100
},
{
"loss": 0.9141,
"grad_norm": 2.65625,
"learning_rate": 2.1949114261468307e-06,
"epoch": 3.169014084507042,
"step": 1125
},
{
"loss": 0.9124,
"grad_norm": 2.84375,
"learning_rate": 1.8512338792058749e-06,
"epoch": 3.23943661971831,
"step": 1150
},
{
"loss": 0.9451,
"grad_norm": 3.015625,
"learning_rate": 1.5340587804874662e-06,
"epoch": 3.3098591549295775,
"step": 1175
},
{
"loss": 0.9383,
"grad_norm": 3.078125,
"learning_rate": 1.2444176869790925e-06,
"epoch": 3.380281690140845,
"step": 1200
},
{
"loss": 0.9216,
"grad_norm": 2.875,
"learning_rate": 9.83252606092675e-07,
"epoch": 3.4507042253521125,
"step": 1225
},
{
"loss": 0.9212,
"grad_norm": 3.109375,
"learning_rate": 7.514129319488839e-07,
"epoch": 3.52112676056338,
"step": 1250
},
{
"loss": 0.8807,
"grad_norm": 2.703125,
"learning_rate": 5.496526828701076e-07,
"epoch": 3.591549295774648,
"step": 1275
},
{
"loss": 0.8916,
"grad_norm": 2.890625,
"learning_rate": 3.786280490666605e-07,
"epoch": 3.6619718309859155,
"step": 1300
},
{
"loss": 0.8853,
"grad_norm": 2.71875,
"learning_rate": 2.3889525849194573e-07,
"epoch": 3.732394366197183,
"step": 1325
},
{
"loss": 0.8886,
"grad_norm": 2.9375,
"learning_rate": 1.3090876780753715e-07,
"epoch": 3.802816901408451,
"step": 1350
},
{
"loss": 0.9125,
"grad_norm": 3.109375,
"learning_rate": 5.501978434171884e-08,
"epoch": 3.873239436619718,
"step": 1375
},
{
"loss": 0.9147,
"grad_norm": 2.9375,
"learning_rate": 1.147512384857663e-08,
"epoch": 3.943661971830986,
"step": 1400
},
{
"train_runtime": 681.2697,
"train_samples_per_second": 66.699,
"train_steps_per_second": 2.084,
"total_flos": 1.6059173098881024e+17,
"train_loss": 1.16697087355063,
"epoch": 4.0,
"step": 1420
}
]
}