{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2882882882882883, "eval_steps": 300, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.005765765765765766, "grad_norm": 2.1474921703338623, "learning_rate": 7.692307692307694e-06, "logits/chosen": -0.4285973310470581, "logits/rejected": -0.721319854259491, "logps/chosen": -2.468954086303711, "logps/rejected": -59.87730407714844, "loss": 0.22946561872959137, "memory(GiB)": 30.65, "nll_loss": 0.13756254315376282, "rewards/accuracies": 0.96875, "rewards/chosen": 0.23724405467510223, "rewards/margins": 3.9806408882141113, "rewards/rejected": -3.743396759033203, "step": 1, "train_speed(iter/s)": 0.01022 }, { "epoch": 0.011531531531531532, "grad_norm": 2.328110456466675, "learning_rate": 1.5384615384615387e-05, "logits/chosen": -0.3982561528682709, "logits/rejected": -0.7214521169662476, "logps/chosen": -3.335645914077759, "logps/rejected": -60.79209899902344, "loss": 0.3770241439342499, "memory(GiB)": 30.65, "nll_loss": 0.23075783252716064, "rewards/accuracies": 0.96875, "rewards/chosen": 0.10687967389822006, "rewards/margins": 3.9392333030700684, "rewards/rejected": -3.832353353500366, "step": 2, "train_speed(iter/s)": 0.010488 }, { "epoch": 0.017297297297297298, "grad_norm": 14.568985939025879, "learning_rate": 2.307692307692308e-05, "logits/chosen": -0.43175598978996277, "logits/rejected": -0.6921666264533997, "logps/chosen": -5.190546035766602, "logps/rejected": -51.33646011352539, "loss": 0.9886025786399841, "memory(GiB)": 34.1, "nll_loss": 0.6371194124221802, "rewards/accuracies": 0.84375, "rewards/chosen": -0.034887176007032394, "rewards/margins": 3.2021734714508057, "rewards/rejected": -3.237060785293579, "step": 3, "train_speed(iter/s)": 0.010581 }, { "epoch": 0.023063063063063063, "grad_norm": 13.817249298095703, "learning_rate": 3.0769230769230774e-05, "logits/chosen": -0.4616771340370178, "logits/rejected": -0.6264235973358154, "logps/chosen": -3.2552552223205566, "logps/rejected": -51.25586700439453, "loss": 0.5021163821220398, "memory(GiB)": 37.58, "nll_loss": 0.26375898718833923, "rewards/accuracies": 0.875, "rewards/chosen": 0.06816040724515915, "rewards/margins": 3.5297036170959473, "rewards/rejected": -3.461543083190918, "step": 4, "train_speed(iter/s)": 0.010625 }, { "epoch": 0.02882882882882883, "grad_norm": 2.363553524017334, "learning_rate": 3.846153846153846e-05, "logits/chosen": -0.48805952072143555, "logits/rejected": -0.7040677070617676, "logps/chosen": -6.89398717880249, "logps/rejected": -59.37879943847656, "loss": 0.39657193422317505, "memory(GiB)": 37.58, "nll_loss": 0.2818652391433716, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1999940723180771, "rewards/margins": 4.230030059814453, "rewards/rejected": -4.030035495758057, "step": 5, "train_speed(iter/s)": 0.010659 }, { "epoch": 0.034594594594594595, "grad_norm": 4.551424026489258, "learning_rate": 4.615384615384616e-05, "logits/chosen": -0.39471542835235596, "logits/rejected": -0.6508359909057617, "logps/chosen": -6.633285999298096, "logps/rejected": -58.268653869628906, "loss": 0.5636770129203796, "memory(GiB)": 41.24, "nll_loss": 0.41472452878952026, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1396198272705078, "rewards/margins": 3.7723348140716553, "rewards/rejected": -3.6327152252197266, "step": 6, "train_speed(iter/s)": 0.010667 }, { "epoch": 0.04036036036036036, "grad_norm": 4.302145481109619, "learning_rate": 5.384615384615385e-05, "logits/chosen": -0.42404329776763916, "logits/rejected": -0.7084805369377136, "logps/chosen": -4.09792947769165, "logps/rejected": -69.69088745117188, "loss": 0.5202179551124573, "memory(GiB)": 41.24, "nll_loss": 0.3875095546245575, "rewards/accuracies": 0.9375, "rewards/chosen": -0.018997177481651306, "rewards/margins": 5.0437703132629395, "rewards/rejected": -5.062767505645752, "step": 7, "train_speed(iter/s)": 0.010685 }, { "epoch": 0.04612612612612613, "grad_norm": 4.475785255432129, "learning_rate": 6.153846153846155e-05, "logits/chosen": -0.4411894977092743, "logits/rejected": -0.6594015955924988, "logps/chosen": -6.067828178405762, "logps/rejected": -52.161441802978516, "loss": 0.8079419136047363, "memory(GiB)": 41.24, "nll_loss": 0.5527109503746033, "rewards/accuracies": 0.875, "rewards/chosen": 0.13843362033367157, "rewards/margins": 3.638244390487671, "rewards/rejected": -3.4998104572296143, "step": 8, "train_speed(iter/s)": 0.010699 }, { "epoch": 0.05189189189189189, "grad_norm": 7.412286281585693, "learning_rate": 6.923076923076924e-05, "logits/chosen": -0.4308490753173828, "logits/rejected": -0.6868806481361389, "logps/chosen": -4.5601372718811035, "logps/rejected": -75.88018798828125, "loss": 0.3704576790332794, "memory(GiB)": 41.24, "nll_loss": 0.23506566882133484, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1938612163066864, "rewards/margins": 5.914104461669922, "rewards/rejected": -5.720243453979492, "step": 9, "train_speed(iter/s)": 0.010708 }, { "epoch": 0.05765765765765766, "grad_norm": 2.0841763019561768, "learning_rate": 7.692307692307693e-05, "logits/chosen": -0.4546598792076111, "logits/rejected": -0.7517622113227844, "logps/chosen": -1.471292495727539, "logps/rejected": -70.88200378417969, "loss": 0.2737431526184082, "memory(GiB)": 41.24, "nll_loss": 0.14067727327346802, "rewards/accuracies": 0.9375, "rewards/chosen": 0.13278257846832275, "rewards/margins": 5.628582000732422, "rewards/rejected": -5.495799541473389, "step": 10, "train_speed(iter/s)": 0.010721 }, { "epoch": 0.06342342342342343, "grad_norm": 5.912591457366943, "learning_rate": 8.461538461538461e-05, "logits/chosen": -0.4128813147544861, "logits/rejected": -0.5927000045776367, "logps/chosen": -7.319942474365234, "logps/rejected": -61.27806091308594, "loss": 0.5680095553398132, "memory(GiB)": 41.24, "nll_loss": 0.3753523826599121, "rewards/accuracies": 0.90625, "rewards/chosen": 0.07616602629423141, "rewards/margins": 4.830938816070557, "rewards/rejected": -4.754772663116455, "step": 11, "train_speed(iter/s)": 0.010727 }, { "epoch": 0.06918918918918919, "grad_norm": 2.5374209880828857, "learning_rate": 9.230769230769232e-05, "logits/chosen": -0.349031925201416, "logits/rejected": -0.6373917460441589, "logps/chosen": -4.199922561645508, "logps/rejected": -72.83607482910156, "loss": 0.34027042984962463, "memory(GiB)": 41.24, "nll_loss": 0.22808796167373657, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20608201622962952, "rewards/margins": 5.424815654754639, "rewards/rejected": -5.218733787536621, "step": 12, "train_speed(iter/s)": 0.010728 }, { "epoch": 0.07495495495495495, "grad_norm": 2.7130517959594727, "learning_rate": 0.0001, "logits/chosen": -0.3631379306316376, "logits/rejected": -0.6601940989494324, "logps/chosen": -3.3938565254211426, "logps/rejected": -65.2313232421875, "loss": 0.4514213800430298, "memory(GiB)": 41.24, "nll_loss": 0.30333614349365234, "rewards/accuracies": 0.9375, "rewards/chosen": 0.06806281208992004, "rewards/margins": 4.726724624633789, "rewards/rejected": -4.658661365509033, "step": 13, "train_speed(iter/s)": 0.010733 }, { "epoch": 0.08072072072072072, "grad_norm": 1.5474798679351807, "learning_rate": 0.0001076923076923077, "logits/chosen": -0.4096493124961853, "logits/rejected": -0.6515597105026245, "logps/chosen": -2.300206184387207, "logps/rejected": -57.26811218261719, "loss": 0.3060320019721985, "memory(GiB)": 41.24, "nll_loss": 0.1727571338415146, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08898697793483734, "rewards/margins": 4.1406354904174805, "rewards/rejected": -4.0516486167907715, "step": 14, "train_speed(iter/s)": 0.010737 }, { "epoch": 0.08648648648648649, "grad_norm": 1.628075361251831, "learning_rate": 0.00011538461538461538, "logits/chosen": -0.4402551054954529, "logits/rejected": -0.6672070622444153, "logps/chosen": -2.9995224475860596, "logps/rejected": -53.87057113647461, "loss": 0.3575773239135742, "memory(GiB)": 41.24, "nll_loss": 0.2217392474412918, "rewards/accuracies": 0.9375, "rewards/chosen": 0.20550209283828735, "rewards/margins": 3.6874935626983643, "rewards/rejected": -3.4819912910461426, "step": 15, "train_speed(iter/s)": 0.010742 }, { "epoch": 0.09225225225225225, "grad_norm": 1.838375449180603, "learning_rate": 0.0001230769230769231, "logits/chosen": -0.3547935485839844, "logits/rejected": -0.6626885533332825, "logps/chosen": -4.558413982391357, "logps/rejected": -64.36922454833984, "loss": 0.45015937089920044, "memory(GiB)": 41.24, "nll_loss": 0.3128659129142761, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14241908490657806, "rewards/margins": 4.83186149597168, "rewards/rejected": -4.689442157745361, "step": 16, "train_speed(iter/s)": 0.010745 }, { "epoch": 0.09801801801801802, "grad_norm": 3.119417667388916, "learning_rate": 0.00013076923076923077, "logits/chosen": -0.3334687352180481, "logits/rejected": -0.6293997168540955, "logps/chosen": -5.949204444885254, "logps/rejected": -74.25395965576172, "loss": 0.6850419044494629, "memory(GiB)": 41.24, "nll_loss": 0.5004001259803772, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07516612857580185, "rewards/margins": 4.788809776306152, "rewards/rejected": -4.713644027709961, "step": 17, "train_speed(iter/s)": 0.010741 }, { "epoch": 0.10378378378378378, "grad_norm": 1.6356091499328613, "learning_rate": 0.00013846153846153847, "logits/chosen": -0.3526935875415802, "logits/rejected": -0.6357190608978271, "logps/chosen": -2.911073923110962, "logps/rejected": -66.46131896972656, "loss": 0.32070592045783997, "memory(GiB)": 41.24, "nll_loss": 0.18397927284240723, "rewards/accuracies": 0.9375, "rewards/chosen": 0.09694083034992218, "rewards/margins": 5.153117656707764, "rewards/rejected": -5.056177139282227, "step": 18, "train_speed(iter/s)": 0.010741 }, { "epoch": 0.10954954954954955, "grad_norm": 2.7403504848480225, "learning_rate": 0.00014615384615384615, "logits/chosen": -0.3763662278652191, "logits/rejected": -0.586420476436615, "logps/chosen": -4.417596340179443, "logps/rejected": -58.99639892578125, "loss": 0.4634058177471161, "memory(GiB)": 41.24, "nll_loss": 0.28715017437934875, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1435782015323639, "rewards/margins": 4.609218120574951, "rewards/rejected": -4.465640068054199, "step": 19, "train_speed(iter/s)": 0.010743 }, { "epoch": 0.11531531531531532, "grad_norm": 1.982851266860962, "learning_rate": 0.00015384615384615385, "logits/chosen": -0.3701193332672119, "logits/rejected": -0.6088087558746338, "logps/chosen": -4.619842529296875, "logps/rejected": -68.1020278930664, "loss": 0.4344192445278168, "memory(GiB)": 41.24, "nll_loss": 0.26591166853904724, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10610304027795792, "rewards/margins": 5.044137954711914, "rewards/rejected": -4.938034534454346, "step": 20, "train_speed(iter/s)": 0.010745 }, { "epoch": 0.12108108108108108, "grad_norm": 3.175961494445801, "learning_rate": 0.00016153846153846155, "logits/chosen": -0.40009674429893494, "logits/rejected": -0.642030656337738, "logps/chosen": -3.357761859893799, "logps/rejected": -65.21231842041016, "loss": 0.40142354369163513, "memory(GiB)": 41.24, "nll_loss": 0.2889588177204132, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1323939859867096, "rewards/margins": 5.234187602996826, "rewards/rejected": -5.1017937660217285, "step": 21, "train_speed(iter/s)": 0.010748 }, { "epoch": 0.12684684684684686, "grad_norm": 1.9400721788406372, "learning_rate": 0.00016923076923076923, "logits/chosen": -0.3025435209274292, "logits/rejected": -0.6950021386146545, "logps/chosen": -2.492130994796753, "logps/rejected": -107.03312683105469, "loss": 0.2920421361923218, "memory(GiB)": 41.24, "nll_loss": 0.19772115349769592, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19073158502578735, "rewards/margins": 8.599780082702637, "rewards/rejected": -8.409048080444336, "step": 22, "train_speed(iter/s)": 0.010746 }, { "epoch": 0.13261261261261262, "grad_norm": 1.3099267482757568, "learning_rate": 0.00017692307692307693, "logits/chosen": -0.36498135328292847, "logits/rejected": -0.6359634399414062, "logps/chosen": -2.421377658843994, "logps/rejected": -74.05368041992188, "loss": 0.20869436860084534, "memory(GiB)": 41.24, "nll_loss": 0.11023169010877609, "rewards/accuracies": 1.0, "rewards/chosen": 0.18500684201717377, "rewards/margins": 5.958514213562012, "rewards/rejected": -5.773507118225098, "step": 23, "train_speed(iter/s)": 0.010747 }, { "epoch": 0.13837837837837838, "grad_norm": 1.9334064722061157, "learning_rate": 0.00018461538461538463, "logits/chosen": -0.45037421584129333, "logits/rejected": -0.7719848155975342, "logps/chosen": -2.6665430068969727, "logps/rejected": -94.5350570678711, "loss": 0.3057625889778137, "memory(GiB)": 41.24, "nll_loss": 0.2374470978975296, "rewards/accuracies": 0.96875, "rewards/chosen": 0.09573014080524445, "rewards/margins": 8.040020942687988, "rewards/rejected": -7.944291114807129, "step": 24, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.14414414414414414, "grad_norm": 7.789314270019531, "learning_rate": 0.00019230769230769233, "logits/chosen": -0.3473276197910309, "logits/rejected": -0.6793957352638245, "logps/chosen": -4.235269069671631, "logps/rejected": -109.01844024658203, "loss": 0.42337244749069214, "memory(GiB)": 41.24, "nll_loss": 0.21255403757095337, "rewards/accuracies": 0.96875, "rewards/chosen": 0.009569963440299034, "rewards/margins": 8.769816398620605, "rewards/rejected": -8.760246276855469, "step": 25, "train_speed(iter/s)": 0.010747 }, { "epoch": 0.1499099099099099, "grad_norm": 1.970948338508606, "learning_rate": 0.0002, "logits/chosen": -0.40258127450942993, "logits/rejected": -0.7479668259620667, "logps/chosen": -2.0013341903686523, "logps/rejected": -85.51154327392578, "loss": 0.4197818636894226, "memory(GiB)": 41.24, "nll_loss": 0.2574591636657715, "rewards/accuracies": 1.0, "rewards/chosen": 0.16396881639957428, "rewards/margins": 7.033238410949707, "rewards/rejected": -6.869269847869873, "step": 26, "train_speed(iter/s)": 0.010746 }, { "epoch": 0.15567567567567567, "grad_norm": 11.3534574508667, "learning_rate": 0.00019999796963348897, "logits/chosen": -0.5246711373329163, "logits/rejected": -0.7294141054153442, "logps/chosen": -11.85606575012207, "logps/rejected": -76.03211975097656, "loss": 0.8875234127044678, "memory(GiB)": 41.24, "nll_loss": 0.575400710105896, "rewards/accuracies": 0.90625, "rewards/chosen": -0.2269383817911148, "rewards/margins": 5.498793125152588, "rewards/rejected": -5.725731372833252, "step": 27, "train_speed(iter/s)": 0.010747 }, { "epoch": 0.16144144144144143, "grad_norm": 2.0314371585845947, "learning_rate": 0.00019999187861640362, "logits/chosen": -0.5284671187400818, "logits/rejected": -0.7846834063529968, "logps/chosen": -4.434022426605225, "logps/rejected": -87.89623260498047, "loss": 0.3868662416934967, "memory(GiB)": 41.24, "nll_loss": 0.30320096015930176, "rewards/accuracies": 0.96875, "rewards/chosen": 0.07812386751174927, "rewards/margins": 7.374299049377441, "rewards/rejected": -7.296175479888916, "step": 28, "train_speed(iter/s)": 0.010748 }, { "epoch": 0.16720720720720722, "grad_norm": 6.089433193206787, "learning_rate": 0.0001999817271960839, "logits/chosen": -0.4792092442512512, "logits/rejected": -0.7371792793273926, "logps/chosen": -3.6791412830352783, "logps/rejected": -80.48262023925781, "loss": 0.34335166215896606, "memory(GiB)": 41.24, "nll_loss": 0.22308313846588135, "rewards/accuracies": 0.96875, "rewards/chosen": -0.049518827348947525, "rewards/margins": 6.395692825317383, "rewards/rejected": -6.445211410522461, "step": 29, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.17297297297297298, "grad_norm": 1.8896535634994507, "learning_rate": 0.00019996751578475186, "logits/chosen": -0.44468259811401367, "logits/rejected": -0.7023504972457886, "logps/chosen": -3.048004388809204, "logps/rejected": -80.6348648071289, "loss": 0.30949145555496216, "memory(GiB)": 41.24, "nll_loss": 0.1800393909215927, "rewards/accuracies": 1.0, "rewards/chosen": 0.15738406777381897, "rewards/margins": 5.8682780265808105, "rewards/rejected": -5.710893630981445, "step": 30, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.17873873873873874, "grad_norm": 2.7516067028045654, "learning_rate": 0.00019994924495949504, "logits/chosen": -0.4754641652107239, "logits/rejected": -0.7408227920532227, "logps/chosen": -5.943354606628418, "logps/rejected": -79.13115692138672, "loss": 0.6435320973396301, "memory(GiB)": 41.24, "nll_loss": 0.4586246609687805, "rewards/accuracies": 0.875, "rewards/chosen": 0.0629303902387619, "rewards/margins": 6.110820293426514, "rewards/rejected": -6.0478901863098145, "step": 31, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.1845045045045045, "grad_norm": 5.854465007781982, "learning_rate": 0.00019992691546224278, "logits/chosen": -0.45127877593040466, "logits/rejected": -0.7568551898002625, "logps/chosen": -2.736678123474121, "logps/rejected": -66.9885025024414, "loss": 0.3652667701244354, "memory(GiB)": 41.24, "nll_loss": 0.16899552941322327, "rewards/accuracies": 0.875, "rewards/chosen": 0.050895966589450836, "rewards/margins": 4.933393478393555, "rewards/rejected": -4.882497310638428, "step": 32, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.19027027027027027, "grad_norm": 1.3124663829803467, "learning_rate": 0.00019990052819973642, "logits/chosen": -0.3465266227722168, "logits/rejected": -0.6685288548469543, "logps/chosen": -3.301164388656616, "logps/rejected": -85.9378662109375, "loss": 0.3046538233757019, "memory(GiB)": 41.24, "nll_loss": 0.1670866757631302, "rewards/accuracies": 0.96875, "rewards/chosen": 0.17874348163604736, "rewards/margins": 6.709518909454346, "rewards/rejected": -6.530775547027588, "step": 33, "train_speed(iter/s)": 0.010748 }, { "epoch": 0.19603603603603603, "grad_norm": 2.341381549835205, "learning_rate": 0.00019987008424349225, "logits/chosen": -0.38037875294685364, "logits/rejected": -0.699614405632019, "logps/chosen": -1.5970546007156372, "logps/rejected": -74.28025817871094, "loss": 0.20820346474647522, "memory(GiB)": 41.24, "nll_loss": 0.10679290443658829, "rewards/accuracies": 0.9375, "rewards/chosen": 0.11616384983062744, "rewards/margins": 5.825808048248291, "rewards/rejected": -5.709644794464111, "step": 34, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.2018018018018018, "grad_norm": 5.144662380218506, "learning_rate": 0.00019983558482975799, "logits/chosen": -0.46614986658096313, "logits/rejected": -0.6599275469779968, "logps/chosen": -5.982501983642578, "logps/rejected": -67.7139892578125, "loss": 0.5879941582679749, "memory(GiB)": 41.24, "nll_loss": 0.4303022027015686, "rewards/accuracies": 0.9375, "rewards/chosen": 0.16055577993392944, "rewards/margins": 5.052016258239746, "rewards/rejected": -4.89146089553833, "step": 35, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.20756756756756756, "grad_norm": 1.990370273590088, "learning_rate": 0.00019979703135946278, "logits/chosen": -0.4655105471611023, "logits/rejected": -0.6668959856033325, "logps/chosen": -4.062808036804199, "logps/rejected": -72.87210845947266, "loss": 0.4453062415122986, "memory(GiB)": 41.24, "nll_loss": 0.25426411628723145, "rewards/accuracies": 0.875, "rewards/chosen": 0.09591292589902878, "rewards/margins": 5.528655052185059, "rewards/rejected": -5.432741641998291, "step": 36, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.21333333333333335, "grad_norm": 2.0748369693756104, "learning_rate": 0.00019975442539816012, "logits/chosen": -0.4139191210269928, "logits/rejected": -0.7536109685897827, "logps/chosen": -5.956673622131348, "logps/rejected": -66.99488830566406, "loss": 0.5514004826545715, "memory(GiB)": 41.24, "nll_loss": 0.3969358503818512, "rewards/accuracies": 0.96875, "rewards/chosen": 0.33245787024497986, "rewards/margins": 5.0754570960998535, "rewards/rejected": -4.742999076843262, "step": 37, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.2190990990990991, "grad_norm": 1.6668081283569336, "learning_rate": 0.0001997077686759643, "logits/chosen": -0.42306363582611084, "logits/rejected": -0.6915761232376099, "logps/chosen": -3.814265727996826, "logps/rejected": -82.30941772460938, "loss": 0.3710038363933563, "memory(GiB)": 41.24, "nll_loss": 0.22380009293556213, "rewards/accuracies": 0.9375, "rewards/chosen": 0.06087161600589752, "rewards/margins": 6.076653957366943, "rewards/rejected": -6.015782356262207, "step": 38, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.22486486486486487, "grad_norm": 13.827637672424316, "learning_rate": 0.00019965706308748028, "logits/chosen": -0.49769100546836853, "logits/rejected": -0.7370949983596802, "logps/chosen": -3.956310272216797, "logps/rejected": -79.41323852539062, "loss": 0.6633445620536804, "memory(GiB)": 41.24, "nll_loss": 0.3870386779308319, "rewards/accuracies": 0.90625, "rewards/chosen": -0.13494591414928436, "rewards/margins": 6.147372722625732, "rewards/rejected": -6.282319068908691, "step": 39, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.23063063063063063, "grad_norm": 2.19854474067688, "learning_rate": 0.0001996023106917267, "logits/chosen": -0.44343504309654236, "logits/rejected": -0.6730125546455383, "logps/chosen": -2.9238576889038086, "logps/rejected": -77.40494537353516, "loss": 0.3453696668148041, "memory(GiB)": 41.24, "nll_loss": 0.19069285690784454, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14595907926559448, "rewards/margins": 6.002254486083984, "rewards/rejected": -5.856295108795166, "step": 40, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.2363963963963964, "grad_norm": 6.0794596672058105, "learning_rate": 0.00019954351371205203, "logits/chosen": -0.47579658031463623, "logits/rejected": -0.6826990842819214, "logps/chosen": -5.335310935974121, "logps/rejected": -75.78384399414062, "loss": 0.575509250164032, "memory(GiB)": 41.24, "nll_loss": 0.4477939307689667, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2103371024131775, "rewards/margins": 6.012211322784424, "rewards/rejected": -5.801875114440918, "step": 41, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.24216216216216216, "grad_norm": 1.4152264595031738, "learning_rate": 0.00019948067453604473, "logits/chosen": -0.49620914459228516, "logits/rejected": -0.7446714043617249, "logps/chosen": -3.284031867980957, "logps/rejected": -77.9183349609375, "loss": 0.29828324913978577, "memory(GiB)": 41.24, "nll_loss": 0.21160344779491425, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18678154051303864, "rewards/margins": 6.247434616088867, "rewards/rejected": -6.060652732849121, "step": 42, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.24792792792792792, "grad_norm": 2.9591963291168213, "learning_rate": 0.00019941379571543596, "logits/chosen": -0.4777877628803253, "logits/rejected": -0.6974171996116638, "logps/chosen": -2.9466118812561035, "logps/rejected": -66.2719497680664, "loss": 0.35521066188812256, "memory(GiB)": 41.24, "nll_loss": 0.22793087363243103, "rewards/accuracies": 0.9375, "rewards/chosen": 0.27246373891830444, "rewards/margins": 5.403186798095703, "rewards/rejected": -5.130722999572754, "step": 43, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.2536936936936937, "grad_norm": 4.199843883514404, "learning_rate": 0.00019934287996599607, "logits/chosen": -0.4372207522392273, "logits/rejected": -0.700534462928772, "logps/chosen": -3.31451416015625, "logps/rejected": -70.0909194946289, "loss": 0.3793654143810272, "memory(GiB)": 41.24, "nll_loss": 0.20433279871940613, "rewards/accuracies": 0.9375, "rewards/chosen": 0.059201404452323914, "rewards/margins": 4.912087917327881, "rewards/rejected": -4.852885723114014, "step": 44, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.2594594594594595, "grad_norm": 0.7397028803825378, "learning_rate": 0.00019926793016742435, "logits/chosen": -0.42062634229660034, "logits/rejected": -0.7593384981155396, "logps/chosen": -1.404799222946167, "logps/rejected": -102.4892349243164, "loss": 0.1313902586698532, "memory(GiB)": 41.24, "nll_loss": 0.09521690011024475, "rewards/accuracies": 1.0, "rewards/chosen": 0.12229674309492111, "rewards/margins": 8.041703224182129, "rewards/rejected": -7.919405937194824, "step": 45, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.26522522522522524, "grad_norm": 5.14201545715332, "learning_rate": 0.00019918894936323195, "logits/chosen": -0.3798273205757141, "logits/rejected": -0.5865642428398132, "logps/chosen": -6.911247730255127, "logps/rejected": -72.06941223144531, "loss": 0.49299517273902893, "memory(GiB)": 41.24, "nll_loss": 0.27924880385398865, "rewards/accuracies": 0.875, "rewards/chosen": 0.1307646483182907, "rewards/margins": 5.647462368011475, "rewards/rejected": -5.516696929931641, "step": 46, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.270990990990991, "grad_norm": 1.6439752578735352, "learning_rate": 0.00019910594076061853, "logits/chosen": -0.4431299567222595, "logits/rejected": -0.7268660664558411, "logps/chosen": -2.0275888442993164, "logps/rejected": -81.84529876708984, "loss": 0.23740296065807343, "memory(GiB)": 41.24, "nll_loss": 0.14832313358783722, "rewards/accuracies": 0.96875, "rewards/chosen": 0.06923090666532516, "rewards/margins": 6.1783928871154785, "rewards/rejected": -6.109161376953125, "step": 47, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.27675675675675676, "grad_norm": 6.499570846557617, "learning_rate": 0.0001990189077303418, "logits/chosen": -0.45142635703086853, "logits/rejected": -0.7249264121055603, "logps/chosen": -5.794652938842773, "logps/rejected": -78.53363800048828, "loss": 0.46158841252326965, "memory(GiB)": 41.24, "nll_loss": 0.3398270010948181, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24555836617946625, "rewards/margins": 6.308343887329102, "rewards/rejected": -6.062786102294922, "step": 48, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.2825225225225225, "grad_norm": 5.58511209487915, "learning_rate": 0.00019892785380658078, "logits/chosen": -0.4099079370498657, "logits/rejected": -0.6898340582847595, "logps/chosen": -7.449429035186768, "logps/rejected": -92.18098449707031, "loss": 0.5815075039863586, "memory(GiB)": 41.24, "nll_loss": 0.41358357667922974, "rewards/accuracies": 0.9375, "rewards/chosen": -0.053265977650880814, "rewards/margins": 7.150655269622803, "rewards/rejected": -7.203920841217041, "step": 49, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.2882882882882883, "grad_norm": 1.5411535501480103, "learning_rate": 0.00019883278268679216, "logits/chosen": -0.4670988917350769, "logits/rejected": -0.6586328148841858, "logps/chosen": -6.984646320343018, "logps/rejected": -89.9208755493164, "loss": 0.45735102891921997, "memory(GiB)": 41.24, "nll_loss": 0.28862154483795166, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1682412177324295, "rewards/margins": 7.457679748535156, "rewards/rejected": -7.289438247680664, "step": 50, "train_speed(iter/s)": 0.01075 } ], "logging_steps": 1, "max_steps": 519, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.7372458004709376e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }