{ "model": "allenai/OLMo-2-0425-1B-Instruct", "corpus": "/root/mt/corpus_C.jsonl.gz", "out": "/root/mt/out", "seed": 17, "block": 1024, "bs": 16, "grad_accum": 2, "lr": 2e-05, "max_steps": 1420, "global_step": 1420, "total_flos": 1.6442086038626304e+17, "train_runtime_s": 696.0254, "train_loss_mean": 1.6962001733376946, "n_docs": 11356, "dataset_tokens_post_truncation": 3343028, "token_len_mean": 294.3842902430433, "sequences_seen": 45440, "epochs_equivalent": 4.001408946812258, "trained_tokens_est": 13376822, "note": "trained_tokens_est excludes padding; total_flos includes padding (collator pads to batch max) so it varies with doc lengths across corpora", "log_history": [ { "loss": 2.8222, "grad_norm": 4.15625, "learning_rate": 1.116279069767442e-05, "epoch": 0.07042253521126761, "step": 25 }, { "loss": 2.2891, "grad_norm": 2.265625, "learning_rate": 1.999906309061717e-05, "epoch": 0.14084507042253522, "step": 50 }, { "loss": 2.1255, "grad_norm": 2.359375, "learning_rate": 1.9974999757800105e-05, "epoch": 0.2112676056338028, "step": 75 }, { "loss": 2.0548, "grad_norm": 2.328125, "learning_rate": 1.9918494468657112e-05, "epoch": 0.28169014084507044, "step": 100 }, { "loss": 2.0386, "grad_norm": 2.375, "learning_rate": 1.982973099683902e-05, "epoch": 0.352112676056338, "step": 125 }, { "loss": 1.9809, "grad_norm": 2.328125, "learning_rate": 1.970899803013991e-05, "epoch": 0.4225352112676056, "step": 150 }, { "loss": 1.9327, "grad_norm": 2.3125, "learning_rate": 1.955668823159015e-05, "epoch": 0.49295774647887325, "step": 175 }, { "loss": 1.9075, "grad_norm": 2.34375, "learning_rate": 1.9373296962387988e-05, "epoch": 0.5633802816901409, "step": 200 }, { "loss": 1.9071, "grad_norm": 2.171875, "learning_rate": 1.915942067082319e-05, "epoch": 0.6338028169014085, "step": 225 }, { "loss": 1.8791, "grad_norm": 2.390625, "learning_rate": 1.8915754952432456e-05, "epoch": 0.704225352112676, "step": 250 }, { "loss": 1.8542, "grad_norm": 2.40625, "learning_rate": 1.8643092287695604e-05, "epoch": 0.7746478873239436, "step": 275 }, { "loss": 1.8437, "grad_norm": 2.375, "learning_rate": 1.8342319464630258e-05, "epoch": 0.8450704225352113, "step": 300 }, { "loss": 1.8306, "grad_norm": 2.328125, "learning_rate": 1.8014414694667685e-05, "epoch": 0.9154929577464789, "step": 325 }, { "loss": 1.8437, "grad_norm": 2.359375, "learning_rate": 1.766044443118978e-05, "epoch": 0.9859154929577465, "step": 350 }, { "loss": 1.7285, "grad_norm": 2.484375, "learning_rate": 1.7281559901074474e-05, "epoch": 1.056338028169014, "step": 375 }, { "loss": 1.6873, "grad_norm": 2.546875, "learning_rate": 1.6878993360529985e-05, "epoch": 1.1267605633802817, "step": 400 }, { "loss": 1.6908, "grad_norm": 2.5, "learning_rate": 1.6454054087395284e-05, "epoch": 1.1971830985915493, "step": 425 }, { "loss": 1.6845, "grad_norm": 2.515625, "learning_rate": 1.6008124122941038e-05, "epoch": 1.267605633802817, "step": 450 }, { "loss": 1.6805, "grad_norm": 2.328125, "learning_rate": 1.554265377702014e-05, "epoch": 1.3380281690140845, "step": 475 }, { "loss": 1.6821, "grad_norm": 2.359375, "learning_rate": 1.5059156911186465e-05, "epoch": 1.408450704225352, "step": 500 }, { "loss": 1.6664, "grad_norm": 2.40625, "learning_rate": 1.455920601512283e-05, "epoch": 1.4788732394366197, "step": 525 }, { "loss": 1.684, "grad_norm": 2.3125, "learning_rate": 1.4044427092391031e-05, "epoch": 1.5492957746478875, "step": 550 }, { "loss": 1.6615, "grad_norm": 2.40625, "learning_rate": 1.3516494372137368e-05, "epoch": 1.619718309859155, "step": 575 }, { "loss": 1.667, "grad_norm": 2.4375, "learning_rate": 1.2977124863952753e-05, "epoch": 1.6901408450704225, "step": 600 }, { "loss": 1.6239, "grad_norm": 2.5625, "learning_rate": 1.2428072773596875e-05, "epoch": 1.76056338028169, "step": 625 }, { "loss": 1.6079, "grad_norm": 2.453125, "learning_rate": 1.1871123797748285e-05, "epoch": 1.8309859154929577, "step": 650 }, { "loss": 1.6291, "grad_norm": 2.546875, "learning_rate": 1.1308089316335695e-05, "epoch": 1.9014084507042255, "step": 675 }, { "loss": 1.625, "grad_norm": 2.375, "learning_rate": 1.0740800501339009e-05, "epoch": 1.971830985915493, "step": 700 }, { "loss": 1.5886, "grad_norm": 2.34375, "learning_rate": 1.0171102361220093e-05, "epoch": 2.0422535211267605, "step": 725 }, { "loss": 1.5726, "grad_norm": 2.53125, "learning_rate": 9.600847740352834e-06, "epoch": 2.112676056338028, "step": 750 }, { "loss": 1.5689, "grad_norm": 2.375, "learning_rate": 9.03189129296821e-06, "epoch": 2.183098591549296, "step": 775 }, { "loss": 1.564, "grad_norm": 2.59375, "learning_rate": 8.466083451213145e-06, "epoch": 2.2535211267605635, "step": 800 }, { "loss": 1.5592, "grad_norm": 2.375, "learning_rate": 7.90526440694096e-06, "epoch": 2.323943661971831, "step": 825 }, { "loss": 1.5616, "grad_norm": 2.328125, "learning_rate": 7.351258126806556e-06, "epoch": 2.3943661971830985, "step": 850 }, { "loss": 1.5456, "grad_norm": 2.515625, "learning_rate": 6.80586642013133e-06, "epoch": 2.464788732394366, "step": 875 }, { "loss": 1.5657, "grad_norm": 2.546875, "learning_rate": 6.2708630788308754e-06, "epoch": 2.535211267605634, "step": 900 }, { "loss": 1.5398, "grad_norm": 2.625, "learning_rate": 5.747988108464501e-06, "epoch": 2.6056338028169015, "step": 925 }, { "loss": 1.5779, "grad_norm": 2.40625, "learning_rate": 5.238942069169e-06, "epoch": 2.676056338028169, "step": 950 }, { "loss": 1.566, "grad_norm": 2.40625, "learning_rate": 4.745380544881779e-06, "epoch": 2.7464788732394365, "step": 975 }, { "loss": 1.5517, "grad_norm": 2.34375, "learning_rate": 4.268908758841318e-06, "epoch": 2.816901408450704, "step": 1000 }, { "loss": 1.544, "grad_norm": 2.5625, "learning_rate": 3.8110763528770543e-06, "epoch": 2.887323943661972, "step": 1025 }, { "loss": 1.5717, "grad_norm": 2.546875, "learning_rate": 3.373372347468141e-06, "epoch": 2.9577464788732395, "step": 1050 }, { "loss": 1.5512, "grad_norm": 2.5, "learning_rate": 2.9572202989626406e-06, "epoch": 3.028169014084507, "step": 1075 }, { "loss": 1.5375, "grad_norm": 2.4375, "learning_rate": 2.5639736697074525e-06, "epoch": 3.0985915492957745, "step": 1100 }, { "loss": 1.545, "grad_norm": 2.390625, "learning_rate": 2.1949114261468307e-06, "epoch": 3.169014084507042, "step": 1125 }, { "loss": 1.5284, "grad_norm": 2.515625, "learning_rate": 1.8512338792058749e-06, "epoch": 3.23943661971831, "step": 1150 }, { "loss": 1.5388, "grad_norm": 2.484375, "learning_rate": 1.5340587804874662e-06, "epoch": 3.3098591549295775, "step": 1175 }, { "loss": 1.5482, "grad_norm": 2.484375, "learning_rate": 1.2444176869790925e-06, "epoch": 3.380281690140845, "step": 1200 }, { "loss": 1.562, "grad_norm": 2.546875, "learning_rate": 9.83252606092675e-07, "epoch": 3.4507042253521125, "step": 1225 }, { "loss": 1.5496, "grad_norm": 2.453125, "learning_rate": 7.514129319488839e-07, "epoch": 3.52112676056338, "step": 1250 }, { "loss": 1.5414, "grad_norm": 2.5, "learning_rate": 5.496526828701076e-07, "epoch": 3.591549295774648, "step": 1275 }, { "loss": 1.554, "grad_norm": 2.578125, "learning_rate": 3.786280490666605e-07, "epoch": 3.6619718309859155, "step": 1300 }, { "loss": 1.5301, "grad_norm": 2.5625, "learning_rate": 2.3889525849194573e-07, "epoch": 3.732394366197183, "step": 1325 }, { "loss": 1.5406, "grad_norm": 2.359375, "learning_rate": 1.3090876780753715e-07, "epoch": 3.802816901408451, "step": 1350 }, { "loss": 1.5475, "grad_norm": 2.46875, "learning_rate": 5.501978434171884e-08, "epoch": 3.873239436619718, "step": 1375 }, { "loss": 1.5372, "grad_norm": 2.53125, "learning_rate": 1.147512384857663e-08, "epoch": 3.943661971830986, "step": 1400 }, { "train_runtime": 696.0254, "train_samples_per_second": 65.285, "train_steps_per_second": 2.04, "total_flos": 1.6442086038626304e+17, "train_loss": 1.6962001733376946, "epoch": 4.0, "step": 1420 } ] }