{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 13, "global_step": 66, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.045454545454545456, "grad_norm": 0.6484919786453247, "learning_rate": 0.0, "loss": 1.5302734375, "step": 1 }, { "epoch": 0.09090909090909091, "grad_norm": 0.6537308692932129, "learning_rate": 2.5e-05, "loss": 1.50732421875, "step": 2 }, { "epoch": 0.13636363636363635, "grad_norm": 0.673050582408905, "learning_rate": 5e-05, "loss": 1.5185546875, "step": 3 }, { "epoch": 0.18181818181818182, "grad_norm": 0.5060420036315918, "learning_rate": 7.500000000000001e-05, "loss": 1.511138916015625, "step": 4 }, { "epoch": 0.22727272727272727, "grad_norm": 0.30887529253959656, "learning_rate": 0.0001, "loss": 1.40087890625, "step": 5 }, { "epoch": 0.2727272727272727, "grad_norm": 0.20122277736663818, "learning_rate": 9.994224282269737e-05, "loss": 1.3603515625, "step": 6 }, { "epoch": 0.3181818181818182, "grad_norm": 0.24981580674648285, "learning_rate": 9.976911955263529e-05, "loss": 1.353271484375, "step": 7 }, { "epoch": 0.36363636363636365, "grad_norm": 0.27218642830848694, "learning_rate": 9.948107459476501e-05, "loss": 1.30078125, "step": 8 }, { "epoch": 0.4090909090909091, "grad_norm": 0.23594558238983154, "learning_rate": 9.907884735636226e-05, "loss": 1.2880859375, "step": 9 }, { "epoch": 0.45454545454545453, "grad_norm": 0.22113916277885437, "learning_rate": 9.856347034897919e-05, "loss": 1.26611328125, "step": 10 }, { "epoch": 0.5, "grad_norm": 0.207451730966568, "learning_rate": 9.793626653800219e-05, "loss": 1.226318359375, "step": 11 }, { "epoch": 0.5454545454545454, "grad_norm": 0.20755015313625336, "learning_rate": 9.719884594661864e-05, "loss": 1.2568359375, "step": 12 }, { "epoch": 0.5909090909090909, "grad_norm": 0.17007851600646973, "learning_rate": 9.635310152291039e-05, "loss": 1.239501953125, "step": 13 }, { "epoch": 0.6363636363636364, "grad_norm": 0.1428622305393219, "learning_rate": 9.540120428068338e-05, "loss": 1.202880859375, "step": 14 }, { "epoch": 0.6363636363636364, "eval_loss": 1.1806640625, "eval_runtime": 5.1037, "eval_samples_per_second": 0.784, "eval_steps_per_second": 0.196, "step": 14 }, { "epoch": 0.6818181818181818, "grad_norm": 0.13083815574645996, "learning_rate": 9.43455977265062e-05, "loss": 1.197509765625, "step": 15 }, { "epoch": 0.7272727272727273, "grad_norm": 0.13909989595413208, "learning_rate": 9.31889915872638e-05, "loss": 1.187744140625, "step": 16 }, { "epoch": 0.7727272727272727, "grad_norm": 0.14068648219108582, "learning_rate": 9.193435485432745e-05, "loss": 1.18115234375, "step": 17 }, { "epoch": 0.8181818181818182, "grad_norm": 0.14103928208351135, "learning_rate": 9.058490816219643e-05, "loss": 1.152587890625, "step": 18 }, { "epoch": 0.8636363636363636, "grad_norm": 0.1104067787528038, "learning_rate": 8.914411552117559e-05, "loss": 1.05517578125, "step": 19 }, { "epoch": 0.9090909090909091, "grad_norm": 0.11927060782909393, "learning_rate": 8.76156754253104e-05, "loss": 1.193359375, "step": 20 }, { "epoch": 0.9545454545454546, "grad_norm": 0.11170849949121475, "learning_rate": 8.600351135840589e-05, "loss": 1.12890625, "step": 21 }, { "epoch": 1.0, "grad_norm": 0.1104699969291687, "learning_rate": 8.431176172250002e-05, "loss": 1.13330078125, "step": 22 }, { "epoch": 1.0454545454545454, "grad_norm": 0.09613741189241409, "learning_rate": 8.254476921464484e-05, "loss": 1.119140625, "step": 23 }, { "epoch": 1.0909090909090908, "grad_norm": 0.09008456021547318, "learning_rate": 8.070706967926565e-05, "loss": 1.09521484375, "step": 24 }, { "epoch": 1.1363636363636362, "grad_norm": 0.09935105592012405, "learning_rate": 7.880338046471331e-05, "loss": 1.09326171875, "step": 25 }, { "epoch": 1.1818181818181819, "grad_norm": 0.09212969243526459, "learning_rate": 7.683858831389867e-05, "loss": 1.159027099609375, "step": 26 }, { "epoch": 1.2272727272727273, "grad_norm": 0.08778497576713562, "learning_rate": 7.481773682009356e-05, "loss": 1.083740234375, "step": 27 }, { "epoch": 1.2272727272727273, "eval_loss": 1.0927734375, "eval_runtime": 5.117, "eval_samples_per_second": 0.782, "eval_steps_per_second": 0.195, "step": 27 }, { "epoch": 1.2727272727272727, "grad_norm": 0.08414468914270401, "learning_rate": 7.274601348009935e-05, "loss": 1.099609375, "step": 28 }, { "epoch": 1.3181818181818181, "grad_norm": 0.08235311508178711, "learning_rate": 7.062873637801692e-05, "loss": 1.10400390625, "step": 29 }, { "epoch": 1.3636363636363638, "grad_norm": 0.0841815173625946, "learning_rate": 6.847134053380112e-05, "loss": 1.07568359375, "step": 30 }, { "epoch": 1.4090909090909092, "grad_norm": 0.07870905101299286, "learning_rate": 6.627936395164243e-05, "loss": 1.087158203125, "step": 31 }, { "epoch": 1.4545454545454546, "grad_norm": 0.09404882043600082, "learning_rate": 6.40584334039897e-05, "loss": 1.08837890625, "step": 32 }, { "epoch": 1.5, "grad_norm": 0.07923950999975204, "learning_rate": 6.181424998770595e-05, "loss": 1.05810546875, "step": 33 }, { "epoch": 1.5454545454545454, "grad_norm": 0.08308933675289154, "learning_rate": 5.955257448943445e-05, "loss": 1.1044921875, "step": 34 }, { "epoch": 1.5909090909090908, "grad_norm": 0.07987320423126221, "learning_rate": 5.727921259774208e-05, "loss": 1.099365234375, "step": 35 }, { "epoch": 1.6363636363636362, "grad_norm": 0.07347641885280609, "learning_rate": 5.500000000000001e-05, "loss": 1.08056640625, "step": 36 }, { "epoch": 1.6818181818181817, "grad_norm": 0.08490364253520966, "learning_rate": 5.2720787402257935e-05, "loss": 1.07666015625, "step": 37 }, { "epoch": 1.7272727272727273, "grad_norm": 0.07508078962564468, "learning_rate": 5.044742551056556e-05, "loss": 1.074951171875, "step": 38 }, { "epoch": 1.7727272727272727, "grad_norm": 0.07631556689739227, "learning_rate": 4.8185750012294065e-05, "loss": 1.07568359375, "step": 39 }, { "epoch": 1.8181818181818183, "grad_norm": 0.08071254193782806, "learning_rate": 4.594156659601029e-05, "loss": 1.05029296875, "step": 40 }, { "epoch": 1.8181818181818183, "eval_loss": 1.055419921875, "eval_runtime": 5.1075, "eval_samples_per_second": 0.783, "eval_steps_per_second": 0.196, "step": 40 }, { "epoch": 1.8636363636363638, "grad_norm": 0.0675211250782013, "learning_rate": 4.372063604835758e-05, "loss": 0.97119140625, "step": 41 }, { "epoch": 1.9090909090909092, "grad_norm": 0.08918321132659912, "learning_rate": 4.152865946619889e-05, "loss": 1.106689453125, "step": 42 }, { "epoch": 1.9545454545454546, "grad_norm": 0.06920626759529114, "learning_rate": 3.93712636219831e-05, "loss": 1.04638671875, "step": 43 }, { "epoch": 2.0, "grad_norm": 0.09061622619628906, "learning_rate": 3.725398651990067e-05, "loss": 1.0537109375, "step": 44 }, { "epoch": 2.0454545454545454, "grad_norm": 0.07046699523925781, "learning_rate": 3.518226317990646e-05, "loss": 1.046142578125, "step": 45 }, { "epoch": 2.090909090909091, "grad_norm": 0.06979958713054657, "learning_rate": 3.3161411686101364e-05, "loss": 1.0283203125, "step": 46 }, { "epoch": 2.1363636363636362, "grad_norm": 0.07331069558858871, "learning_rate": 3.119661953528671e-05, "loss": 1.03173828125, "step": 47 }, { "epoch": 2.1818181818181817, "grad_norm": 0.07536927610635757, "learning_rate": 2.9292930320734335e-05, "loss": 1.0992240905761719, "step": 48 }, { "epoch": 2.227272727272727, "grad_norm": 0.07666821032762527, "learning_rate": 2.745523078535517e-05, "loss": 1.026611328125, "step": 49 }, { "epoch": 2.2727272727272725, "grad_norm": 0.06852415204048157, "learning_rate": 2.568823827750001e-05, "loss": 1.045654296875, "step": 50 }, { "epoch": 2.3181818181818183, "grad_norm": 0.07268761098384857, "learning_rate": 2.39964886415941e-05, "loss": 1.05419921875, "step": 51 }, { "epoch": 2.3636363636363638, "grad_norm": 0.07941761612892151, "learning_rate": 2.2384324574689612e-05, "loss": 1.030029296875, "step": 52 }, { "epoch": 2.409090909090909, "grad_norm": 0.06556671112775803, "learning_rate": 2.0855884478824412e-05, "loss": 1.0439453125, "step": 53 }, { "epoch": 2.409090909090909, "eval_loss": 1.040771484375, "eval_runtime": 5.1085, "eval_samples_per_second": 0.783, "eval_steps_per_second": 0.196, "step": 53 }, { "epoch": 2.4545454545454546, "grad_norm": 0.0690130963921547, "learning_rate": 1.9415091837803573e-05, "loss": 1.046875, "step": 54 }, { "epoch": 2.5, "grad_norm": 0.07252095639705658, "learning_rate": 1.806564514567258e-05, "loss": 1.015380859375, "step": 55 }, { "epoch": 2.5454545454545454, "grad_norm": 0.07445185631513596, "learning_rate": 1.6811008412736208e-05, "loss": 1.06787109375, "step": 56 }, { "epoch": 2.590909090909091, "grad_norm": 0.07511234283447266, "learning_rate": 1.5654402273493805e-05, "loss": 1.0625, "step": 57 }, { "epoch": 2.6363636363636362, "grad_norm": 0.06960045546293259, "learning_rate": 1.459879571931663e-05, "loss": 1.047119140625, "step": 58 }, { "epoch": 2.6818181818181817, "grad_norm": 0.07280787080526352, "learning_rate": 1.3646898477089626e-05, "loss": 1.0400390625, "step": 59 }, { "epoch": 2.7272727272727275, "grad_norm": 0.07160894572734833, "learning_rate": 1.2801154053381386e-05, "loss": 1.046142578125, "step": 60 }, { "epoch": 2.7727272727272725, "grad_norm": 0.06884549558162689, "learning_rate": 1.2063733461997805e-05, "loss": 1.048095703125, "step": 61 }, { "epoch": 2.8181818181818183, "grad_norm": 0.07696957141160965, "learning_rate": 1.1436529651020813e-05, "loss": 1.02294921875, "step": 62 }, { "epoch": 2.8636363636363638, "grad_norm": 0.06252304464578629, "learning_rate": 1.092115264363775e-05, "loss": 0.94873046875, "step": 63 }, { "epoch": 2.909090909090909, "grad_norm": 0.0684686005115509, "learning_rate": 1.0518925405234989e-05, "loss": 1.083984375, "step": 64 }, { "epoch": 2.9545454545454546, "grad_norm": 0.06993022561073303, "learning_rate": 1.023088044736472e-05, "loss": 1.02392578125, "step": 65 }, { "epoch": 3.0, "grad_norm": 0.07079355418682098, "learning_rate": 1.0057757177302627e-05, "loss": 1.0322265625, "step": 66 }, { "epoch": 3.0, "eval_loss": 1.032470703125, "eval_runtime": 5.1167, "eval_samples_per_second": 0.782, "eval_steps_per_second": 0.195, "step": 66 } ], "logging_steps": 1.0, "max_steps": 66, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.335415292244001e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }