{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.12373366328976877, "eval_steps": 300, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0024746732657953754, "grad_norm": 11.35000991821289, "learning_rate": 3.278688524590164e-06, "logits/chosen": -0.6587307453155518, "logits/rejected": -0.6631469130516052, "logps/chosen": -13.55949878692627, "logps/rejected": -27.670433044433594, "loss": 1.6191432476043701, "memory(GiB)": 45.42, "nll_loss": 0.9259958863258362, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.005221 }, { "epoch": 0.004949346531590751, "grad_norm": 9.617626190185547, "learning_rate": 6.557377049180328e-06, "logits/chosen": -0.6030034422874451, "logits/rejected": -0.6114212274551392, "logps/chosen": -14.923763275146484, "logps/rejected": -29.194869995117188, "loss": 1.6753138303756714, "memory(GiB)": 45.42, "nll_loss": 0.9821667671203613, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005275 }, { "epoch": 0.007424019797386126, "grad_norm": 8.504729270935059, "learning_rate": 9.836065573770493e-06, "logits/chosen": -0.5661746859550476, "logits/rejected": -0.5726399421691895, "logps/chosen": -13.571891784667969, "logps/rejected": -26.323240280151367, "loss": 1.6620099544525146, "memory(GiB)": 46.09, "nll_loss": 0.9678325057029724, "rewards/accuracies": 0.53125, "rewards/chosen": -0.003509162925183773, "rewards/margins": -0.001862737350165844, "rewards/rejected": -0.0016464253421872854, "step": 3, "train_speed(iter/s)": 0.005301 }, { "epoch": 0.009898693063181502, "grad_norm": 11.376845359802246, "learning_rate": 1.3114754098360657e-05, "logits/chosen": -0.6604664921760559, "logits/rejected": -0.6652082800865173, "logps/chosen": -12.837306022644043, "logps/rejected": -23.095237731933594, "loss": 1.663628339767456, "memory(GiB)": 46.09, "nll_loss": 0.975486695766449, "rewards/accuracies": 0.6875, "rewards/chosen": 0.00841558538377285, "rewards/margins": 0.010128158144652843, "rewards/rejected": -0.0017125748563557863, "step": 4, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.012373366328976877, "grad_norm": 5.700821399688721, "learning_rate": 1.6393442622950818e-05, "logits/chosen": -0.6459366083145142, "logits/rejected": -0.6513304710388184, "logps/chosen": -18.565486907958984, "logps/rejected": -23.259275436401367, "loss": 1.594820261001587, "memory(GiB)": 46.09, "nll_loss": 0.8972694277763367, "rewards/accuracies": 0.375, "rewards/chosen": 0.00964329019188881, "rewards/margins": -0.008526789955794811, "rewards/rejected": 0.018170079216361046, "step": 5, "train_speed(iter/s)": 0.005387 }, { "epoch": 0.014848039594772253, "grad_norm": 8.467960357666016, "learning_rate": 1.9672131147540985e-05, "logits/chosen": -0.6038874387741089, "logits/rejected": -0.6043834090232849, "logps/chosen": -13.40754508972168, "logps/rejected": -18.13410758972168, "loss": 1.6557857990264893, "memory(GiB)": 46.09, "nll_loss": 0.960586428642273, "rewards/accuracies": 0.46875, "rewards/chosen": 0.030818985775113106, "rewards/margins": -0.003026916179805994, "rewards/rejected": 0.03384590521454811, "step": 6, "train_speed(iter/s)": 0.005393 }, { "epoch": 0.017322712860567628, "grad_norm": 10.094538688659668, "learning_rate": 2.295081967213115e-05, "logits/chosen": -0.5412906408309937, "logits/rejected": -0.5506806969642639, "logps/chosen": -12.647178649902344, "logps/rejected": -27.220874786376953, "loss": 1.5276265144348145, "memory(GiB)": 46.09, "nll_loss": 0.8624258637428284, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08376072347164154, "rewards/margins": 0.06035517156124115, "rewards/rejected": 0.023405561223626137, "step": 7, "train_speed(iter/s)": 0.005386 }, { "epoch": 0.019797386126363004, "grad_norm": 8.840508460998535, "learning_rate": 2.6229508196721314e-05, "logits/chosen": -0.6647145748138428, "logits/rejected": -0.6669148206710815, "logps/chosen": -14.856410026550293, "logps/rejected": -21.21141815185547, "loss": 1.492944598197937, "memory(GiB)": 46.09, "nll_loss": 0.844528317451477, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11737693846225739, "rewards/margins": 0.09855899959802628, "rewards/rejected": 0.01881793886423111, "step": 8, "train_speed(iter/s)": 0.005383 }, { "epoch": 0.02227205939215838, "grad_norm": 6.475947380065918, "learning_rate": 2.9508196721311478e-05, "logits/chosen": -0.6404256224632263, "logits/rejected": -0.6432085037231445, "logps/chosen": -12.697021484375, "logps/rejected": -22.463302612304688, "loss": 1.3507211208343506, "memory(GiB)": 46.09, "nll_loss": 0.6943754553794861, "rewards/accuracies": 0.59375, "rewards/chosen": 0.18904930353164673, "rewards/margins": 0.11120466142892838, "rewards/rejected": 0.07784464210271835, "step": 9, "train_speed(iter/s)": 0.005379 }, { "epoch": 0.024746732657953754, "grad_norm": 3.908445119857788, "learning_rate": 3.2786885245901635e-05, "logits/chosen": -0.6233164668083191, "logits/rejected": -0.6281710863113403, "logps/chosen": -12.109004974365234, "logps/rejected": -25.513099670410156, "loss": 1.1971133947372437, "memory(GiB)": 46.09, "nll_loss": 0.523026704788208, "rewards/accuracies": 0.5625, "rewards/chosen": 0.1465698629617691, "rewards/margins": 0.09749479591846466, "rewards/rejected": 0.04907506704330444, "step": 10, "train_speed(iter/s)": 0.005374 }, { "epoch": 0.02722140592374913, "grad_norm": 10.216607093811035, "learning_rate": 3.6065573770491806e-05, "logits/chosen": -0.6259695291519165, "logits/rejected": -0.6286618709564209, "logps/chosen": -14.0396146774292, "logps/rejected": -21.92095947265625, "loss": 1.4379217624664307, "memory(GiB)": 46.09, "nll_loss": 0.7931011915206909, "rewards/accuracies": 0.65625, "rewards/chosen": 0.10121297836303711, "rewards/margins": 0.2612895369529724, "rewards/rejected": -0.1600765436887741, "step": 11, "train_speed(iter/s)": 0.005372 }, { "epoch": 0.029696079189544505, "grad_norm": 6.620578765869141, "learning_rate": 3.934426229508197e-05, "logits/chosen": -0.6335112452507019, "logits/rejected": -0.638087809085846, "logps/chosen": -9.480979919433594, "logps/rejected": -24.5159912109375, "loss": 1.1956348419189453, "memory(GiB)": 46.09, "nll_loss": 0.5891170501708984, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07576582580804825, "rewards/margins": 0.3991776704788208, "rewards/rejected": -0.32341182231903076, "step": 12, "train_speed(iter/s)": 0.005391 }, { "epoch": 0.03217075245533988, "grad_norm": 6.803226947784424, "learning_rate": 4.262295081967213e-05, "logits/chosen": -0.6281187534332275, "logits/rejected": -0.6315115690231323, "logps/chosen": -18.412860870361328, "logps/rejected": -27.436920166015625, "loss": 1.5400699377059937, "memory(GiB)": 46.09, "nll_loss": 0.88338702917099, "rewards/accuracies": 0.625, "rewards/chosen": -0.10771963745355606, "rewards/margins": 0.27280330657958984, "rewards/rejected": -0.3805229365825653, "step": 13, "train_speed(iter/s)": 0.005388 }, { "epoch": 0.034645425721135256, "grad_norm": 9.147095680236816, "learning_rate": 4.59016393442623e-05, "logits/chosen": -0.6376056671142578, "logits/rejected": -0.6407235264778137, "logps/chosen": -17.056198120117188, "logps/rejected": -25.44281768798828, "loss": 1.7076380252838135, "memory(GiB)": 46.09, "nll_loss": 0.973918616771698, "rewards/accuracies": 0.59375, "rewards/chosen": -0.14579348266124725, "rewards/margins": 0.050162509083747864, "rewards/rejected": -0.19595597684383392, "step": 14, "train_speed(iter/s)": 0.005397 }, { "epoch": 0.03712009898693063, "grad_norm": 4.252878189086914, "learning_rate": 4.918032786885246e-05, "logits/chosen": -0.5979167222976685, "logits/rejected": -0.6013778448104858, "logps/chosen": -12.705180168151855, "logps/rejected": -26.116336822509766, "loss": 1.3297263383865356, "memory(GiB)": 46.09, "nll_loss": 0.7305101156234741, "rewards/accuracies": 0.6875, "rewards/chosen": -0.06688955426216125, "rewards/margins": 0.28163066506385803, "rewards/rejected": -0.3485202193260193, "step": 15, "train_speed(iter/s)": 0.005401 }, { "epoch": 0.03959477225272601, "grad_norm": 3.8650903701782227, "learning_rate": 5.245901639344263e-05, "logits/chosen": -0.5886881351470947, "logits/rejected": -0.5908396244049072, "logps/chosen": -22.1767578125, "logps/rejected": -32.695167541503906, "loss": 1.450103521347046, "memory(GiB)": 46.09, "nll_loss": 0.7899419069290161, "rewards/accuracies": 0.65625, "rewards/chosen": -0.05856169015169144, "rewards/margins": 0.17948633432388306, "rewards/rejected": -0.2380480319261551, "step": 16, "train_speed(iter/s)": 0.005395 }, { "epoch": 0.04206944551852138, "grad_norm": 3.568068742752075, "learning_rate": 5.5737704918032785e-05, "logits/chosen": -0.557040810585022, "logits/rejected": -0.5580084919929504, "logps/chosen": -17.01874542236328, "logps/rejected": -27.190898895263672, "loss": 1.4369667768478394, "memory(GiB)": 46.09, "nll_loss": 0.7801130414009094, "rewards/accuracies": 0.6875, "rewards/chosen": 0.07399038225412369, "rewards/margins": 0.22467321157455444, "rewards/rejected": -0.15068282186985016, "step": 17, "train_speed(iter/s)": 0.005403 }, { "epoch": 0.04454411878431676, "grad_norm": 4.3334150314331055, "learning_rate": 5.9016393442622956e-05, "logits/chosen": -0.5880481600761414, "logits/rejected": -0.5887515544891357, "logps/chosen": -21.928936004638672, "logps/rejected": -22.768033981323242, "loss": 1.6926015615463257, "memory(GiB)": 46.09, "nll_loss": 0.9716537594795227, "rewards/accuracies": 0.5, "rewards/chosen": 0.0877460390329361, "rewards/margins": 0.0405881404876709, "rewards/rejected": 0.047157879918813705, "step": 18, "train_speed(iter/s)": 0.005402 }, { "epoch": 0.04701879205011213, "grad_norm": 2.5271899700164795, "learning_rate": 6.229508196721313e-05, "logits/chosen": -0.598438560962677, "logits/rejected": -0.604390025138855, "logps/chosen": -17.247812271118164, "logps/rejected": -31.589086532592773, "loss": 1.248651385307312, "memory(GiB)": 46.09, "nll_loss": 0.6379994750022888, "rewards/accuracies": 0.5625, "rewards/chosen": 0.2769991457462311, "rewards/margins": 0.2692391276359558, "rewards/rejected": 0.0077600013464689255, "step": 19, "train_speed(iter/s)": 0.005406 }, { "epoch": 0.04949346531590751, "grad_norm": 3.571847915649414, "learning_rate": 6.557377049180327e-05, "logits/chosen": -0.5842810273170471, "logits/rejected": -0.5847360491752625, "logps/chosen": -15.484521865844727, "logps/rejected": -20.548080444335938, "loss": 1.5169799327850342, "memory(GiB)": 46.09, "nll_loss": 0.7671993374824524, "rewards/accuracies": 0.40625, "rewards/chosen": 0.08881673216819763, "rewards/margins": -0.04343637824058533, "rewards/rejected": 0.13225311040878296, "step": 20, "train_speed(iter/s)": 0.00541 }, { "epoch": 0.051968138581702884, "grad_norm": 2.258408546447754, "learning_rate": 6.885245901639344e-05, "logits/chosen": -0.548245906829834, "logits/rejected": -0.551019549369812, "logps/chosen": -12.056645393371582, "logps/rejected": -22.498403549194336, "loss": 1.2092863321304321, "memory(GiB)": 46.09, "nll_loss": 0.5635381937026978, "rewards/accuracies": 0.59375, "rewards/chosen": 0.24224215745925903, "rewards/margins": 0.19714026153087616, "rewards/rejected": 0.045101895928382874, "step": 21, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.05444281184749826, "grad_norm": 4.153398036956787, "learning_rate": 7.213114754098361e-05, "logits/chosen": -0.5542203783988953, "logits/rejected": -0.5555762052536011, "logps/chosen": -10.120831489562988, "logps/rejected": -21.4542236328125, "loss": 1.2580621242523193, "memory(GiB)": 46.09, "nll_loss": 0.6088542342185974, "rewards/accuracies": 0.625, "rewards/chosen": 0.2806166112422943, "rewards/margins": 0.14948059618473053, "rewards/rejected": 0.1311360001564026, "step": 22, "train_speed(iter/s)": 0.005422 }, { "epoch": 0.056917485113293635, "grad_norm": 2.784181833267212, "learning_rate": 7.540983606557377e-05, "logits/chosen": -0.6017516255378723, "logits/rejected": -0.6026712656021118, "logps/chosen": -14.456979751586914, "logps/rejected": -21.297657012939453, "loss": 1.2428232431411743, "memory(GiB)": 46.09, "nll_loss": 0.5972878932952881, "rewards/accuracies": 0.53125, "rewards/chosen": 0.27611616253852844, "rewards/margins": 0.14373204112052917, "rewards/rejected": 0.13238413631916046, "step": 23, "train_speed(iter/s)": 0.005422 }, { "epoch": 0.05939215837908901, "grad_norm": 2.2945520877838135, "learning_rate": 7.868852459016394e-05, "logits/chosen": -0.5793949961662292, "logits/rejected": -0.5800157785415649, "logps/chosen": -9.155426979064941, "logps/rejected": -22.067913055419922, "loss": 1.1942368745803833, "memory(GiB)": 46.09, "nll_loss": 0.5604769587516785, "rewards/accuracies": 0.6875, "rewards/chosen": 0.29127371311187744, "rewards/margins": 0.17932376265525818, "rewards/rejected": 0.11194998770952225, "step": 24, "train_speed(iter/s)": 0.005419 }, { "epoch": 0.061866831644884386, "grad_norm": 2.7884368896484375, "learning_rate": 8.19672131147541e-05, "logits/chosen": -0.5844717621803284, "logits/rejected": -0.5868740677833557, "logps/chosen": -13.537481307983398, "logps/rejected": -17.04685401916504, "loss": 1.218743920326233, "memory(GiB)": 46.09, "nll_loss": 0.6010019779205322, "rewards/accuracies": 0.65625, "rewards/chosen": 0.38273870944976807, "rewards/margins": 0.2067541480064392, "rewards/rejected": 0.17598456144332886, "step": 25, "train_speed(iter/s)": 0.005422 }, { "epoch": 0.06434150491067976, "grad_norm": 2.3340394496917725, "learning_rate": 8.524590163934426e-05, "logits/chosen": -0.6258128881454468, "logits/rejected": -0.6279971599578857, "logps/chosen": -9.657672882080078, "logps/rejected": -22.88201904296875, "loss": 1.114503264427185, "memory(GiB)": 46.09, "nll_loss": 0.5605608820915222, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3312107026576996, "rewards/margins": 0.372702419757843, "rewards/rejected": -0.04149174690246582, "step": 26, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.06681617817647514, "grad_norm": 3.664553165435791, "learning_rate": 8.852459016393443e-05, "logits/chosen": -0.5701621770858765, "logits/rejected": -0.5702242851257324, "logps/chosen": -15.183746337890625, "logps/rejected": -17.559988021850586, "loss": 1.4017894268035889, "memory(GiB)": 46.09, "nll_loss": 0.7635535597801208, "rewards/accuracies": 0.65625, "rewards/chosen": 0.21464091539382935, "rewards/margins": 0.1838790327310562, "rewards/rejected": 0.03076188825070858, "step": 27, "train_speed(iter/s)": 0.005417 }, { "epoch": 0.06929085144227051, "grad_norm": 2.2080814838409424, "learning_rate": 9.18032786885246e-05, "logits/chosen": -0.5039485096931458, "logits/rejected": -0.5086482763290405, "logps/chosen": -8.541333198547363, "logps/rejected": -27.416786193847656, "loss": 1.032238483428955, "memory(GiB)": 46.09, "nll_loss": 0.42585042119026184, "rewards/accuracies": 0.6875, "rewards/chosen": 0.29641830921173096, "rewards/margins": 0.3008955717086792, "rewards/rejected": -0.004477284848690033, "step": 28, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.0717655247080659, "grad_norm": 2.4612784385681152, "learning_rate": 9.508196721311476e-05, "logits/chosen": -0.5983453989028931, "logits/rejected": -0.6011134386062622, "logps/chosen": -9.658693313598633, "logps/rejected": -25.247703552246094, "loss": 1.0381165742874146, "memory(GiB)": 46.09, "nll_loss": 0.46968621015548706, "rewards/accuracies": 0.6875, "rewards/chosen": 0.30931776762008667, "rewards/margins": 0.36611291766166687, "rewards/rejected": -0.05679512768983841, "step": 29, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.07424019797386126, "grad_norm": 3.299984931945801, "learning_rate": 9.836065573770493e-05, "logits/chosen": -0.5566404461860657, "logits/rejected": -0.5608186721801758, "logps/chosen": -11.162762641906738, "logps/rejected": -25.61810874938965, "loss": 1.2033004760742188, "memory(GiB)": 46.09, "nll_loss": 0.6197662949562073, "rewards/accuracies": 0.78125, "rewards/chosen": 0.3209737241268158, "rewards/margins": 0.38564494252204895, "rewards/rejected": -0.06467118114233017, "step": 30, "train_speed(iter/s)": 0.005432 }, { "epoch": 0.07671487123965665, "grad_norm": 3.927424430847168, "learning_rate": 0.00010163934426229508, "logits/chosen": -0.5413897037506104, "logits/rejected": -0.5447396636009216, "logps/chosen": -7.564568042755127, "logps/rejected": -23.63496208190918, "loss": 1.1393965482711792, "memory(GiB)": 46.09, "nll_loss": 0.5696667432785034, "rewards/accuracies": 0.71875, "rewards/chosen": 0.27428141236305237, "rewards/margins": 0.5005658864974976, "rewards/rejected": -0.2262844443321228, "step": 31, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.07918954450545201, "grad_norm": 3.8795111179351807, "learning_rate": 0.00010491803278688525, "logits/chosen": -0.6150721311569214, "logits/rejected": -0.6170963048934937, "logps/chosen": -15.14966869354248, "logps/rejected": -21.37498664855957, "loss": 1.2894086837768555, "memory(GiB)": 46.09, "nll_loss": 0.6919065713882446, "rewards/accuracies": 0.65625, "rewards/chosen": 0.2811221778392792, "rewards/margins": 0.3919064402580261, "rewards/rejected": -0.11078427731990814, "step": 32, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.0816642177712474, "grad_norm": 3.8578360080718994, "learning_rate": 0.00010819672131147543, "logits/chosen": -0.6152044534683228, "logits/rejected": -0.615663468837738, "logps/chosen": -11.967881202697754, "logps/rejected": -20.445411682128906, "loss": 1.1714155673980713, "memory(GiB)": 46.09, "nll_loss": 0.5518181324005127, "rewards/accuracies": 0.65625, "rewards/chosen": 0.21441030502319336, "rewards/margins": 0.2466525286436081, "rewards/rejected": -0.03224220499396324, "step": 33, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.08413889103704277, "grad_norm": 3.3592934608459473, "learning_rate": 0.00011147540983606557, "logits/chosen": -0.6198133826255798, "logits/rejected": -0.6197149753570557, "logps/chosen": -11.38640308380127, "logps/rejected": -22.015522003173828, "loss": 1.1110243797302246, "memory(GiB)": 46.09, "nll_loss": 0.5177969932556152, "rewards/accuracies": 0.71875, "rewards/chosen": 0.23841583728790283, "rewards/margins": 0.32188504934310913, "rewards/rejected": -0.0834691971540451, "step": 34, "train_speed(iter/s)": 0.00543 }, { "epoch": 0.08661356430283815, "grad_norm": 2.9654669761657715, "learning_rate": 0.00011475409836065574, "logits/chosen": -0.6268936991691589, "logits/rejected": -0.6304693818092346, "logps/chosen": -8.792684555053711, "logps/rejected": -27.867855072021484, "loss": 0.9397363662719727, "memory(GiB)": 46.09, "nll_loss": 0.44072026014328003, "rewards/accuracies": 0.75, "rewards/chosen": 0.2782461643218994, "rewards/margins": 0.6700869202613831, "rewards/rejected": -0.39184072613716125, "step": 35, "train_speed(iter/s)": 0.00543 }, { "epoch": 0.08908823756863352, "grad_norm": 4.219470977783203, "learning_rate": 0.00011803278688524591, "logits/chosen": -0.5896088480949402, "logits/rejected": -0.5908181667327881, "logps/chosen": -9.439773559570312, "logps/rejected": -21.788042068481445, "loss": 1.1120812892913818, "memory(GiB)": 46.09, "nll_loss": 0.5399542450904846, "rewards/accuracies": 0.625, "rewards/chosen": 0.19946175813674927, "rewards/margins": 0.4053455591201782, "rewards/rejected": -0.20588380098342896, "step": 36, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.0915629108344289, "grad_norm": 4.5739665031433105, "learning_rate": 0.00012131147540983607, "logits/chosen": -0.6280671954154968, "logits/rejected": -0.6325269937515259, "logps/chosen": -8.791489601135254, "logps/rejected": -30.336650848388672, "loss": 1.1410616636276245, "memory(GiB)": 46.09, "nll_loss": 0.6490904688835144, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2655602991580963, "rewards/margins": 0.6452851891517639, "rewards/rejected": -0.3797248899936676, "step": 37, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.09403758410022427, "grad_norm": 3.020256280899048, "learning_rate": 0.00012459016393442625, "logits/chosen": -0.6382966637611389, "logits/rejected": -0.6446542143821716, "logps/chosen": -12.288652420043945, "logps/rejected": -31.03972625732422, "loss": 0.9547407031059265, "memory(GiB)": 46.09, "nll_loss": 0.574475109577179, "rewards/accuracies": 0.875, "rewards/chosen": 0.3463619351387024, "rewards/margins": 1.0072863101959229, "rewards/rejected": -0.6609243154525757, "step": 38, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.09651225736601965, "grad_norm": 3.258894205093384, "learning_rate": 0.0001278688524590164, "logits/chosen": -0.6787834763526917, "logits/rejected": -0.6786651015281677, "logps/chosen": -12.136661529541016, "logps/rejected": -20.544681549072266, "loss": 1.0752589702606201, "memory(GiB)": 46.09, "nll_loss": 0.6294119358062744, "rewards/accuracies": 0.875, "rewards/chosen": 0.34082022309303284, "rewards/margins": 0.8202961683273315, "rewards/rejected": -0.4794759452342987, "step": 39, "train_speed(iter/s)": 0.005436 }, { "epoch": 0.09898693063181502, "grad_norm": 3.8263096809387207, "learning_rate": 0.00013114754098360654, "logits/chosen": -0.6569682359695435, "logits/rejected": -0.6592159271240234, "logps/chosen": -21.227203369140625, "logps/rejected": -24.57542610168457, "loss": 1.3819258213043213, "memory(GiB)": 46.09, "nll_loss": 0.8235953450202942, "rewards/accuracies": 0.75, "rewards/chosen": 0.12423999607563019, "rewards/margins": 0.5565845966339111, "rewards/rejected": -0.43234458565711975, "step": 40, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.1014616038976104, "grad_norm": 3.6862781047821045, "learning_rate": 0.00013442622950819673, "logits/chosen": -0.6126083135604858, "logits/rejected": -0.618023157119751, "logps/chosen": -18.38534927368164, "logps/rejected": -31.6680850982666, "loss": 1.0961635112762451, "memory(GiB)": 46.09, "nll_loss": 0.6294427514076233, "rewards/accuracies": 0.90625, "rewards/chosen": 0.16896528005599976, "rewards/margins": 0.7662918567657471, "rewards/rejected": -0.5973266363143921, "step": 41, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.10393627716340577, "grad_norm": 2.924959897994995, "learning_rate": 0.00013770491803278688, "logits/chosen": -0.6756088137626648, "logits/rejected": -0.6791292428970337, "logps/chosen": -12.787935256958008, "logps/rejected": -35.33570861816406, "loss": 0.9558172821998596, "memory(GiB)": 46.09, "nll_loss": 0.45665955543518066, "rewards/accuracies": 0.71875, "rewards/chosen": 0.14984729886054993, "rewards/margins": 0.7973157167434692, "rewards/rejected": -0.6474683880805969, "step": 42, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.10641095042920115, "grad_norm": 5.650424480438232, "learning_rate": 0.00014098360655737707, "logits/chosen": -0.6601684093475342, "logits/rejected": -0.667102038860321, "logps/chosen": -12.86988639831543, "logps/rejected": -33.79030227661133, "loss": 0.97264564037323, "memory(GiB)": 46.09, "nll_loss": 0.5231238603591919, "rewards/accuracies": 0.78125, "rewards/chosen": 0.10155264288187027, "rewards/margins": 0.8151469230651855, "rewards/rejected": -0.7135943174362183, "step": 43, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.10888562369499652, "grad_norm": 4.125715732574463, "learning_rate": 0.00014426229508196722, "logits/chosen": -0.615486741065979, "logits/rejected": -0.6166262030601501, "logps/chosen": -22.158443450927734, "logps/rejected": -30.26171112060547, "loss": 1.174919843673706, "memory(GiB)": 46.09, "nll_loss": 0.67107754945755, "rewards/accuracies": 0.75, "rewards/chosen": 0.12467168271541595, "rewards/margins": 1.025106430053711, "rewards/rejected": -0.9004346132278442, "step": 44, "train_speed(iter/s)": 0.005437 }, { "epoch": 0.1113602969607919, "grad_norm": 4.247290134429932, "learning_rate": 0.00014754098360655738, "logits/chosen": -0.6652258634567261, "logits/rejected": -0.672545313835144, "logps/chosen": -9.705460548400879, "logps/rejected": -31.59243392944336, "loss": 0.9555923342704773, "memory(GiB)": 46.09, "nll_loss": 0.5207614302635193, "rewards/accuracies": 0.75, "rewards/chosen": 0.2395530790090561, "rewards/margins": 1.0814993381500244, "rewards/rejected": -0.8419461846351624, "step": 45, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.11383497022658727, "grad_norm": 3.2860352993011475, "learning_rate": 0.00015081967213114754, "logits/chosen": -0.614319920539856, "logits/rejected": -0.619287371635437, "logps/chosen": -13.63390064239502, "logps/rejected": -35.74215316772461, "loss": 0.9872268438339233, "memory(GiB)": 46.09, "nll_loss": 0.6003797650337219, "rewards/accuracies": 0.8125, "rewards/chosen": 0.28653809428215027, "rewards/margins": 1.200305461883545, "rewards/rejected": -0.9137674570083618, "step": 46, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.11630964349238265, "grad_norm": 5.599460601806641, "learning_rate": 0.0001540983606557377, "logits/chosen": -0.6212424039840698, "logits/rejected": -0.6217514276504517, "logps/chosen": -17.058250427246094, "logps/rejected": -29.002065658569336, "loss": 1.1983596086502075, "memory(GiB)": 46.09, "nll_loss": 0.7794193029403687, "rewards/accuracies": 0.8125, "rewards/chosen": 0.22204741835594177, "rewards/margins": 0.9237122535705566, "rewards/rejected": -0.7016648054122925, "step": 47, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.11878431675817802, "grad_norm": 4.221462726593018, "learning_rate": 0.00015737704918032788, "logits/chosen": -0.6427355408668518, "logits/rejected": -0.6452814936637878, "logps/chosen": -13.284379005432129, "logps/rejected": -28.47121238708496, "loss": 0.9505041241645813, "memory(GiB)": 46.09, "nll_loss": 0.5451131463050842, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22931885719299316, "rewards/margins": 0.9360889792442322, "rewards/rejected": -0.706770122051239, "step": 48, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.1212589900239734, "grad_norm": 4.555298328399658, "learning_rate": 0.00016065573770491804, "logits/chosen": -0.6409769058227539, "logits/rejected": -0.6388667225837708, "logps/chosen": -12.98600959777832, "logps/rejected": -19.881681442260742, "loss": 1.2290067672729492, "memory(GiB)": 46.09, "nll_loss": 0.5956090688705444, "rewards/accuracies": 0.59375, "rewards/chosen": 0.07330272346735, "rewards/margins": 0.5512866973876953, "rewards/rejected": -0.47798389196395874, "step": 49, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.12373366328976877, "grad_norm": 3.2366769313812256, "learning_rate": 0.0001639344262295082, "logits/chosen": -0.6371148228645325, "logits/rejected": -0.6468245983123779, "logps/chosen": -20.83090591430664, "logps/rejected": -45.217796325683594, "loss": 0.996230959892273, "memory(GiB)": 46.09, "nll_loss": 0.6383583545684814, "rewards/accuracies": 0.75, "rewards/chosen": 0.13887403905391693, "rewards/margins": 1.3918437957763672, "rewards/rejected": -1.252969741821289, "step": 50, "train_speed(iter/s)": 0.005439 } ], "logging_steps": 1, "max_steps": 1212, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.492565635857121e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }