PEFT
Safetensors
task1p / trainer_state.json
chen
Upload folder using huggingface_hub
5b2d711 verified
Raw
History Blame Contribute Delete
384 kB
{
"best_global_step": 600,
"best_metric": 0.24665305,
"best_model_checkpoint": "/data2/kdd/crag/cjz/output/dpo_phase2/v1-20250528-012105/checkpoint-600",
"epoch": 1.210047967684928,
"eval_steps": 300,
"global_step": 600,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002019691996970462,
"grad_norm": 12.761810302734375,
"learning_rate": 4.000000000000001e-06,
"logits/chosen": -0.5775864720344543,
"logits/rejected": -0.7030954360961914,
"logps/chosen": -6.236894130706787,
"logps/rejected": -24.46524429321289,
"loss": 1.2380319833755493,
"memory(GiB)": 32.64,
"nll_loss": 0.5448847413063049,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.0187
},
{
"epoch": 0.004039383993940924,
"grad_norm": 8.313699722290039,
"learning_rate": 8.000000000000001e-06,
"logits/chosen": -0.8238492012023926,
"logits/rejected": -0.8350682258605957,
"logps/chosen": -5.732274055480957,
"logps/rejected": -11.927969932556152,
"loss": 1.4877614974975586,
"memory(GiB)": 32.64,
"nll_loss": 0.7946141958236694,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.020044
},
{
"epoch": 0.006059075990911386,
"grad_norm": 21.77679443359375,
"learning_rate": 1.2e-05,
"logits/chosen": -0.6877153515815735,
"logits/rejected": -0.7822633981704712,
"logps/chosen": -7.046360015869141,
"logps/rejected": -14.666805267333984,
"loss": 1.5761629343032837,
"memory(GiB)": 35.3,
"nll_loss": 0.8832842707633972,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.0033746182452887297,
"rewards/margins": 0.0006902526365593076,
"rewards/rejected": 0.0026843654923141003,
"step": 3,
"train_speed(iter/s)": 0.020481
},
{
"epoch": 0.008078767987881848,
"grad_norm": 12.999642372131348,
"learning_rate": 1.6000000000000003e-05,
"logits/chosen": -0.7259287238121033,
"logits/rejected": -0.8152387142181396,
"logps/chosen": -4.8744587898254395,
"logps/rejected": -14.308876991271973,
"loss": 1.4366666078567505,
"memory(GiB)": 35.3,
"nll_loss": 0.7484119534492493,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0021331249736249447,
"rewards/margins": 0.009978920221328735,
"rewards/rejected": -0.007845795713365078,
"step": 4,
"train_speed(iter/s)": 0.020724
},
{
"epoch": 0.01009845998485231,
"grad_norm": 12.841984748840332,
"learning_rate": 2e-05,
"logits/chosen": -0.681520402431488,
"logits/rejected": -0.7851653695106506,
"logps/chosen": -5.029726982116699,
"logps/rejected": -16.70825958251953,
"loss": 1.2887729406356812,
"memory(GiB)": 35.3,
"nll_loss": 0.6066412329673767,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.02295457012951374,
"rewards/margins": 0.022426389157772064,
"rewards/rejected": 0.0005281821941025555,
"step": 5,
"train_speed(iter/s)": 0.020852
},
{
"epoch": 0.012118151981822771,
"grad_norm": 13.818325996398926,
"learning_rate": 2.4e-05,
"logits/chosen": -0.6980650424957275,
"logits/rejected": -0.8158392310142517,
"logps/chosen": -4.0964484214782715,
"logps/rejected": -15.3903169631958,
"loss": 1.3540700674057007,
"memory(GiB)": 35.3,
"nll_loss": 0.6896780133247375,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.06763897091150284,
"rewards/margins": 0.06137145683169365,
"rewards/rejected": 0.00626751035451889,
"step": 6,
"train_speed(iter/s)": 0.020943
},
{
"epoch": 0.014137843978793235,
"grad_norm": 8.670878410339355,
"learning_rate": 2.8000000000000003e-05,
"logits/chosen": -0.6072264909744263,
"logits/rejected": -0.7461887001991272,
"logps/chosen": -6.871906757354736,
"logps/rejected": -19.193540573120117,
"loss": 1.1981984376907349,
"memory(GiB)": 35.3,
"nll_loss": 0.5265603065490723,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.04815364256501198,
"rewards/margins": 0.053483281284570694,
"rewards/rejected": -0.005329643841832876,
"step": 7,
"train_speed(iter/s)": 0.020996
},
{
"epoch": 0.016157535975763696,
"grad_norm": 4.796175003051758,
"learning_rate": 3.2000000000000005e-05,
"logits/chosen": -0.7197842597961426,
"logits/rejected": -0.7792064547538757,
"logps/chosen": -7.072351455688477,
"logps/rejected": -14.618125915527344,
"loss": 1.1894290447235107,
"memory(GiB)": 35.3,
"nll_loss": 0.4693164825439453,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.13033029437065125,
"rewards/margins": -0.01030611153692007,
"rewards/rejected": 0.1406363844871521,
"step": 8,
"train_speed(iter/s)": 0.021046
},
{
"epoch": 0.018177227972734158,
"grad_norm": 6.6790852546691895,
"learning_rate": 3.6e-05,
"logits/chosen": -0.689906656742096,
"logits/rejected": -0.8183166980743408,
"logps/chosen": -1.6468329429626465,
"logps/rejected": -13.756692886352539,
"loss": 0.8348377346992493,
"memory(GiB)": 35.3,
"nll_loss": 0.2248959094285965,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.1438780128955841,
"rewards/margins": 0.22025901079177856,
"rewards/rejected": -0.07638098299503326,
"step": 9,
"train_speed(iter/s)": 0.021091
},
{
"epoch": 0.02019691996970462,
"grad_norm": 11.680863380432129,
"learning_rate": 4e-05,
"logits/chosen": -0.7386271953582764,
"logits/rejected": -0.8098344206809998,
"logps/chosen": -3.001471996307373,
"logps/rejected": -16.38292694091797,
"loss": 1.0789214372634888,
"memory(GiB)": 35.3,
"nll_loss": 0.5013705492019653,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18567466735839844,
"rewards/margins": 0.40445780754089355,
"rewards/rejected": -0.21878314018249512,
"step": 10,
"train_speed(iter/s)": 0.021135
},
{
"epoch": 0.02221661196667508,
"grad_norm": 6.016479015350342,
"learning_rate": 4.4000000000000006e-05,
"logits/chosen": -0.6199511289596558,
"logits/rejected": -0.7641665935516357,
"logps/chosen": -1.786482810974121,
"logps/rejected": -23.814146041870117,
"loss": 0.6213081479072571,
"memory(GiB)": 38.2,
"nll_loss": 0.17753979563713074,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1519775092601776,
"rewards/margins": 0.6798387169837952,
"rewards/rejected": -0.5278611779212952,
"step": 11,
"train_speed(iter/s)": 0.021205
},
{
"epoch": 0.024236303963645543,
"grad_norm": 19.226726531982422,
"learning_rate": 4.8e-05,
"logits/chosen": -0.7735041975975037,
"logits/rejected": -0.8182462453842163,
"logps/chosen": -6.024149417877197,
"logps/rejected": -14.866905212402344,
"loss": 1.467666506767273,
"memory(GiB)": 38.2,
"nll_loss": 0.8242200016975403,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.03484102711081505,
"rewards/margins": 0.42743903398513794,
"rewards/rejected": -0.4622800350189209,
"step": 12,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 0.026255995960616008,
"grad_norm": 3.4483253955841064,
"learning_rate": 5.2000000000000004e-05,
"logits/chosen": -0.754300594329834,
"logits/rejected": -0.7772647738456726,
"logps/chosen": -3.619762659072876,
"logps/rejected": -17.524477005004883,
"loss": 0.7115153074264526,
"memory(GiB)": 38.2,
"nll_loss": 0.2013324648141861,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10463516414165497,
"rewards/margins": 0.7878110408782959,
"rewards/rejected": -0.6831759214401245,
"step": 13,
"train_speed(iter/s)": 0.021242
},
{
"epoch": 0.02827568795758647,
"grad_norm": 15.451835632324219,
"learning_rate": 5.6000000000000006e-05,
"logits/chosen": -0.7475101947784424,
"logits/rejected": -0.8498263359069824,
"logps/chosen": -3.9441192150115967,
"logps/rejected": -21.486186981201172,
"loss": 0.9213531613349915,
"memory(GiB)": 38.2,
"nll_loss": 0.5798130035400391,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.09564964473247528,
"rewards/margins": 1.039682149887085,
"rewards/rejected": -0.9440325498580933,
"step": 14,
"train_speed(iter/s)": 0.021265
},
{
"epoch": 0.03029537995455693,
"grad_norm": 3.8979263305664062,
"learning_rate": 6e-05,
"logits/chosen": -0.6522198915481567,
"logits/rejected": -0.7548784017562866,
"logps/chosen": -2.765364408493042,
"logps/rejected": -21.602596282958984,
"loss": 0.6480428576469421,
"memory(GiB)": 38.2,
"nll_loss": 0.23036827147006989,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.13951444625854492,
"rewards/margins": 0.8476398587226868,
"rewards/rejected": -0.7081253528594971,
"step": 15,
"train_speed(iter/s)": 0.021272
},
{
"epoch": 0.03231507195152739,
"grad_norm": 7.998473644256592,
"learning_rate": 6.400000000000001e-05,
"logits/chosen": -0.7795235514640808,
"logits/rejected": -0.8571889400482178,
"logps/chosen": -2.1100573539733887,
"logps/rejected": -13.082208633422852,
"loss": 0.8766142129898071,
"memory(GiB)": 38.2,
"nll_loss": 0.41500476002693176,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11589755117893219,
"rewards/margins": 0.6957570910453796,
"rewards/rejected": -0.5798596143722534,
"step": 16,
"train_speed(iter/s)": 0.021293
},
{
"epoch": 0.034334763948497854,
"grad_norm": 2.908738613128662,
"learning_rate": 6.800000000000001e-05,
"logits/chosen": -0.7900448441505432,
"logits/rejected": -0.8519578576087952,
"logps/chosen": -3.0429553985595703,
"logps/rejected": -13.749216079711914,
"loss": 0.7060399651527405,
"memory(GiB)": 38.2,
"nll_loss": 0.27812597155570984,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.40308868885040283,
"rewards/margins": 0.7511462569236755,
"rewards/rejected": -0.3480575382709503,
"step": 17,
"train_speed(iter/s)": 0.021313
},
{
"epoch": 0.036354455945468316,
"grad_norm": 4.66619348526001,
"learning_rate": 7.2e-05,
"logits/chosen": -0.7611753344535828,
"logits/rejected": -0.8464637398719788,
"logps/chosen": -3.652045488357544,
"logps/rejected": -19.29679298400879,
"loss": 0.9751962423324585,
"memory(GiB)": 38.2,
"nll_loss": 0.4190734326839447,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.08509862422943115,
"rewards/margins": 0.42228081822395325,
"rewards/rejected": -0.3371821641921997,
"step": 18,
"train_speed(iter/s)": 0.021323
},
{
"epoch": 0.03837414794243878,
"grad_norm": 4.54453706741333,
"learning_rate": 7.6e-05,
"logits/chosen": -0.7284001708030701,
"logits/rejected": -0.7670996189117432,
"logps/chosen": -6.018934726715088,
"logps/rejected": -13.253512382507324,
"loss": 1.2025885581970215,
"memory(GiB)": 38.2,
"nll_loss": 0.45651721954345703,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0025453297421336174,
"rewards/margins": 0.006808534264564514,
"rewards/rejected": -0.004263207316398621,
"step": 19,
"train_speed(iter/s)": 0.021331
},
{
"epoch": 0.04039383993940924,
"grad_norm": 2.965843677520752,
"learning_rate": 8e-05,
"logits/chosen": -0.674504280090332,
"logits/rejected": -0.7847579121589661,
"logps/chosen": -3.122269630432129,
"logps/rejected": -16.265222549438477,
"loss": 0.9356863498687744,
"memory(GiB)": 38.2,
"nll_loss": 0.2812672257423401,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.12974591553211212,
"rewards/margins": 0.18470463156700134,
"rewards/rejected": -0.05495870113372803,
"step": 20,
"train_speed(iter/s)": 0.021338
},
{
"epoch": 0.0424135319363797,
"grad_norm": 3.544822931289673,
"learning_rate": 8.4e-05,
"logits/chosen": -0.8259390592575073,
"logits/rejected": -0.8455062508583069,
"logps/chosen": -6.160022258758545,
"logps/rejected": -8.875776290893555,
"loss": 1.0958666801452637,
"memory(GiB)": 38.2,
"nll_loss": 0.4123613238334656,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.17430700361728668,
"rewards/margins": 0.11852678656578064,
"rewards/rejected": 0.05578019842505455,
"step": 21,
"train_speed(iter/s)": 0.021349
},
{
"epoch": 0.04443322393335016,
"grad_norm": 2.8963093757629395,
"learning_rate": 8.800000000000001e-05,
"logits/chosen": -0.7398238778114319,
"logits/rejected": -0.83761066198349,
"logps/chosen": -2.3067612648010254,
"logps/rejected": -13.408963203430176,
"loss": 0.9400858879089355,
"memory(GiB)": 38.2,
"nll_loss": 0.26946064829826355,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1603003889322281,
"rewards/margins": 0.15373794734477997,
"rewards/rejected": 0.00656244158744812,
"step": 22,
"train_speed(iter/s)": 0.021358
},
{
"epoch": 0.046452915930320623,
"grad_norm": 3.5623438358306885,
"learning_rate": 9.200000000000001e-05,
"logits/chosen": -0.6750966906547546,
"logits/rejected": -0.7796332836151123,
"logps/chosen": -3.6001622676849365,
"logps/rejected": -14.151020050048828,
"loss": 1.0653876066207886,
"memory(GiB)": 38.2,
"nll_loss": 0.4920450747013092,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2231697142124176,
"rewards/margins": 0.34812790155410767,
"rewards/rejected": -0.12495820969343185,
"step": 23,
"train_speed(iter/s)": 0.021362
},
{
"epoch": 0.048472607927291085,
"grad_norm": 3.5425710678100586,
"learning_rate": 9.6e-05,
"logits/chosen": -0.7490979433059692,
"logits/rejected": -0.8129041194915771,
"logps/chosen": -2.327343463897705,
"logps/rejected": -10.883130073547363,
"loss": 0.921205461025238,
"memory(GiB)": 38.2,
"nll_loss": 0.2920321822166443,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09307915717363358,
"rewards/margins": 0.1912679672241211,
"rewards/rejected": -0.09818882495164871,
"step": 24,
"train_speed(iter/s)": 0.021367
},
{
"epoch": 0.05049229992426155,
"grad_norm": 4.050752639770508,
"learning_rate": 0.0001,
"logits/chosen": -0.6667495965957642,
"logits/rejected": -0.7579994201660156,
"logps/chosen": -6.037406921386719,
"logps/rejected": -19.315378189086914,
"loss": 0.8225780725479126,
"memory(GiB)": 38.2,
"nll_loss": 0.3186819851398468,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3055117130279541,
"rewards/margins": 0.4999930262565613,
"rewards/rejected": -0.19448129832744598,
"step": 25,
"train_speed(iter/s)": 0.021364
},
{
"epoch": 0.052511991921232015,
"grad_norm": 3.7214102745056152,
"learning_rate": 0.00010400000000000001,
"logits/chosen": -0.7550854086875916,
"logits/rejected": -0.8332770466804504,
"logps/chosen": -3.076296329498291,
"logps/rejected": -13.947905540466309,
"loss": 1.0035364627838135,
"memory(GiB)": 38.2,
"nll_loss": 0.3730461597442627,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.03216666728258133,
"rewards/margins": 0.19776780903339386,
"rewards/rejected": -0.16560114920139313,
"step": 26,
"train_speed(iter/s)": 0.02137
},
{
"epoch": 0.05453168391820248,
"grad_norm": 7.799258708953857,
"learning_rate": 0.00010800000000000001,
"logits/chosen": -0.6102021932601929,
"logits/rejected": -0.7568979263305664,
"logps/chosen": -5.391008377075195,
"logps/rejected": -21.710432052612305,
"loss": 1.2860000133514404,
"memory(GiB)": 41.88,
"nll_loss": 0.6317353844642639,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.007743582129478455,
"rewards/margins": 0.258750855922699,
"rewards/rejected": -0.2510072588920593,
"step": 27,
"train_speed(iter/s)": 0.021361
},
{
"epoch": 0.05655137591517294,
"grad_norm": 3.4134862422943115,
"learning_rate": 0.00011200000000000001,
"logits/chosen": -0.681388795375824,
"logits/rejected": -0.7808853983879089,
"logps/chosen": -5.752387523651123,
"logps/rejected": -19.651212692260742,
"loss": 1.1130492687225342,
"memory(GiB)": 41.88,
"nll_loss": 0.4609695374965668,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.029274294152855873,
"rewards/margins": 0.19754451513290405,
"rewards/rejected": -0.16827021539211273,
"step": 28,
"train_speed(iter/s)": 0.021358
},
{
"epoch": 0.0585710679121434,
"grad_norm": 2.6125388145446777,
"learning_rate": 0.000116,
"logits/chosen": -0.6846833229064941,
"logits/rejected": -0.7732559442520142,
"logps/chosen": -2.147914171218872,
"logps/rejected": -14.99377727508545,
"loss": 0.6967631578445435,
"memory(GiB)": 41.88,
"nll_loss": 0.18463140726089478,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3106439709663391,
"rewards/margins": 0.524000346660614,
"rewards/rejected": -0.2133564054965973,
"step": 29,
"train_speed(iter/s)": 0.021362
},
{
"epoch": 0.06059075990911386,
"grad_norm": 3.1886954307556152,
"learning_rate": 0.00012,
"logits/chosen": -0.7671568393707275,
"logits/rejected": -0.8747203946113586,
"logps/chosen": -1.0704294443130493,
"logps/rejected": -15.217928886413574,
"loss": 0.6793683171272278,
"memory(GiB)": 41.88,
"nll_loss": 0.11626588553190231,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2649898827075958,
"rewards/margins": 0.3756120800971985,
"rewards/rejected": -0.11062214523553848,
"step": 30,
"train_speed(iter/s)": 0.02137
},
{
"epoch": 0.06261045190608432,
"grad_norm": 3.672961711883545,
"learning_rate": 0.000124,
"logits/chosen": -0.6060948967933655,
"logits/rejected": -0.7454618811607361,
"logps/chosen": -3.801156997680664,
"logps/rejected": -23.42005157470703,
"loss": 1.0564124584197998,
"memory(GiB)": 41.88,
"nll_loss": 0.4279017746448517,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.18183766305446625,
"rewards/margins": 0.23221838474273682,
"rewards/rejected": -0.050380729138851166,
"step": 31,
"train_speed(iter/s)": 0.021365
},
{
"epoch": 0.06463014390305478,
"grad_norm": 5.934133529663086,
"learning_rate": 0.00012800000000000002,
"logits/chosen": -0.7708523869514465,
"logits/rejected": -0.81435227394104,
"logps/chosen": -2.663968801498413,
"logps/rejected": -11.808816909790039,
"loss": 0.9843453168869019,
"memory(GiB)": 41.88,
"nll_loss": 0.37907925248146057,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.18125101923942566,
"rewards/margins": 0.27721551060676575,
"rewards/rejected": -0.0959644690155983,
"step": 32,
"train_speed(iter/s)": 0.021371
},
{
"epoch": 0.06664983590002524,
"grad_norm": 3.0649428367614746,
"learning_rate": 0.000132,
"logits/chosen": -0.651940107345581,
"logits/rejected": -0.7574964761734009,
"logps/chosen": -1.5061438083648682,
"logps/rejected": -21.272098541259766,
"loss": 0.670626163482666,
"memory(GiB)": 41.88,
"nll_loss": 0.23393775522708893,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.312156617641449,
"rewards/margins": 0.6968778967857361,
"rewards/rejected": -0.38472118973731995,
"step": 33,
"train_speed(iter/s)": 0.021373
},
{
"epoch": 0.06866952789699571,
"grad_norm": 3.6389997005462646,
"learning_rate": 0.00013600000000000003,
"logits/chosen": -0.6423748731613159,
"logits/rejected": -0.6685101985931396,
"logps/chosen": -6.548682689666748,
"logps/rejected": -13.626079559326172,
"loss": 1.1170402765274048,
"memory(GiB)": 41.88,
"nll_loss": 0.480682373046875,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.2068958729505539,
"rewards/margins": 0.31287699937820435,
"rewards/rejected": -0.10598116368055344,
"step": 34,
"train_speed(iter/s)": 0.021372
},
{
"epoch": 0.07068921989396618,
"grad_norm": 2.625232219696045,
"learning_rate": 0.00014,
"logits/chosen": -0.5362560749053955,
"logits/rejected": -0.7028357982635498,
"logps/chosen": -3.359612464904785,
"logps/rejected": -33.268436431884766,
"loss": 0.8328565955162048,
"memory(GiB)": 41.88,
"nll_loss": 0.28516510128974915,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.05316687747836113,
"rewards/margins": 0.685168981552124,
"rewards/rejected": -0.6320021748542786,
"step": 35,
"train_speed(iter/s)": 0.02137
},
{
"epoch": 0.07270891189093663,
"grad_norm": 2.7919955253601074,
"learning_rate": 0.000144,
"logits/chosen": -0.6247209906578064,
"logits/rejected": -0.7358378767967224,
"logps/chosen": -4.632122039794922,
"logps/rejected": -18.708053588867188,
"loss": 0.719286322593689,
"memory(GiB)": 41.88,
"nll_loss": 0.25582897663116455,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.32600465416908264,
"rewards/margins": 0.7712743282318115,
"rewards/rejected": -0.44526970386505127,
"step": 36,
"train_speed(iter/s)": 0.021371
},
{
"epoch": 0.0747286038879071,
"grad_norm": 2.5269482135772705,
"learning_rate": 0.000148,
"logits/chosen": -0.6388774514198303,
"logits/rejected": -0.7476755976676941,
"logps/chosen": -1.6513766050338745,
"logps/rejected": -20.447532653808594,
"loss": 0.652652382850647,
"memory(GiB)": 41.88,
"nll_loss": 0.181876540184021,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2968735098838806,
"rewards/margins": 0.7243574857711792,
"rewards/rejected": -0.4274839758872986,
"step": 37,
"train_speed(iter/s)": 0.021373
},
{
"epoch": 0.07674829588487755,
"grad_norm": 2.419584274291992,
"learning_rate": 0.000152,
"logits/chosen": -0.5964392423629761,
"logits/rejected": -0.7218829393386841,
"logps/chosen": -1.5039414167404175,
"logps/rejected": -27.090576171875,
"loss": 0.6621359586715698,
"memory(GiB)": 41.88,
"nll_loss": 0.14563477039337158,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.28821805119514465,
"rewards/margins": 0.77447509765625,
"rewards/rejected": -0.48625698685646057,
"step": 38,
"train_speed(iter/s)": 0.021373
},
{
"epoch": 0.07876798788184802,
"grad_norm": 3.088440179824829,
"learning_rate": 0.00015600000000000002,
"logits/chosen": -0.7012370824813843,
"logits/rejected": -0.8179476261138916,
"logps/chosen": -1.9244059324264526,
"logps/rejected": -21.519695281982422,
"loss": 0.6807724237442017,
"memory(GiB)": 41.88,
"nll_loss": 0.244890034198761,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.15054234862327576,
"rewards/margins": 0.9000046849250793,
"rewards/rejected": -0.749462366104126,
"step": 39,
"train_speed(iter/s)": 0.021371
},
{
"epoch": 0.08078767987881848,
"grad_norm": 2.713752508163452,
"learning_rate": 0.00016,
"logits/chosen": -0.6608636379241943,
"logits/rejected": -0.7343001365661621,
"logps/chosen": -4.701538562774658,
"logps/rejected": -27.00352668762207,
"loss": 0.6774569749832153,
"memory(GiB)": 41.88,
"nll_loss": 0.2570435106754303,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.13876499235630035,
"rewards/margins": 1.0153288841247559,
"rewards/rejected": -0.8765639066696167,
"step": 40,
"train_speed(iter/s)": 0.021373
},
{
"epoch": 0.08280737187578895,
"grad_norm": 4.948164463043213,
"learning_rate": 0.000164,
"logits/chosen": -0.6391008496284485,
"logits/rejected": -0.6671096682548523,
"logps/chosen": -8.970189094543457,
"logps/rejected": -14.413579940795898,
"loss": 1.0303566455841064,
"memory(GiB)": 41.88,
"nll_loss": 0.41976141929626465,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0029628686606884003,
"rewards/margins": 0.573236882686615,
"rewards/rejected": -0.5761997699737549,
"step": 41,
"train_speed(iter/s)": 0.021375
},
{
"epoch": 0.0848270638727594,
"grad_norm": 4.40416955947876,
"learning_rate": 0.000168,
"logits/chosen": -0.6820927858352661,
"logits/rejected": -0.7476735711097717,
"logps/chosen": -4.897199630737305,
"logps/rejected": -17.570022583007812,
"loss": 0.9847887754440308,
"memory(GiB)": 41.88,
"nll_loss": 0.42955508828163147,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.08176113665103912,
"rewards/margins": 0.5534911155700684,
"rewards/rejected": -0.47172996401786804,
"step": 42,
"train_speed(iter/s)": 0.021376
},
{
"epoch": 0.08684675586972987,
"grad_norm": 5.150269508361816,
"learning_rate": 0.000172,
"logits/chosen": -0.7095463275909424,
"logits/rejected": -0.7945126891136169,
"logps/chosen": -4.1012396812438965,
"logps/rejected": -20.216747283935547,
"loss": 0.956037700176239,
"memory(GiB)": 41.88,
"nll_loss": 0.5109948515892029,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19462859630584717,
"rewards/margins": 0.853682279586792,
"rewards/rejected": -0.6590536832809448,
"step": 43,
"train_speed(iter/s)": 0.021378
},
{
"epoch": 0.08886644786670032,
"grad_norm": 4.477358341217041,
"learning_rate": 0.00017600000000000002,
"logits/chosen": -0.7657253742218018,
"logits/rejected": -0.8225359320640564,
"logps/chosen": -2.71124267578125,
"logps/rejected": -13.512589454650879,
"loss": 0.8599216341972351,
"memory(GiB)": 41.88,
"nll_loss": 0.27771878242492676,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.13035942614078522,
"rewards/margins": 0.38512665033340454,
"rewards/rejected": -0.25476720929145813,
"step": 44,
"train_speed(iter/s)": 0.021381
},
{
"epoch": 0.09088613986367079,
"grad_norm": 5.4391255378723145,
"learning_rate": 0.00018,
"logits/chosen": -0.6582808494567871,
"logits/rejected": -0.7074710726737976,
"logps/chosen": -5.520257472991943,
"logps/rejected": -18.50946044921875,
"loss": 0.8143137693405151,
"memory(GiB)": 41.88,
"nll_loss": 0.2541295886039734,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06929375976324081,
"rewards/margins": 0.6602391004562378,
"rewards/rejected": -0.590945303440094,
"step": 45,
"train_speed(iter/s)": 0.02138
},
{
"epoch": 0.09290583186064125,
"grad_norm": 4.585366249084473,
"learning_rate": 0.00018400000000000003,
"logits/chosen": -0.722661018371582,
"logits/rejected": -0.7770288586616516,
"logps/chosen": -3.6351494789123535,
"logps/rejected": -10.902822494506836,
"loss": 1.1608294248580933,
"memory(GiB)": 41.88,
"nll_loss": 0.47840094566345215,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.09331849962472916,
"rewards/margins": 0.1440279632806778,
"rewards/rejected": -0.05070946365594864,
"step": 46,
"train_speed(iter/s)": 0.021384
},
{
"epoch": 0.09492552385761172,
"grad_norm": 4.578927040100098,
"learning_rate": 0.000188,
"logits/chosen": -0.6195976734161377,
"logits/rejected": -0.7779173254966736,
"logps/chosen": -0.9245270490646362,
"logps/rejected": -30.03981590270996,
"loss": 0.5132064819335938,
"memory(GiB)": 41.88,
"nll_loss": 0.10489758849143982,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2798718214035034,
"rewards/margins": 0.944153904914856,
"rewards/rejected": -0.6642820835113525,
"step": 47,
"train_speed(iter/s)": 0.021382
},
{
"epoch": 0.09694521585458217,
"grad_norm": 6.127289772033691,
"learning_rate": 0.000192,
"logits/chosen": -0.6809214949607849,
"logits/rejected": -0.7704883813858032,
"logps/chosen": -1.4336328506469727,
"logps/rejected": -16.669113159179688,
"loss": 0.8413453102111816,
"memory(GiB)": 41.88,
"nll_loss": 0.27693358063697815,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1910504847764969,
"rewards/margins": 0.4971596598625183,
"rewards/rejected": -0.30610913038253784,
"step": 48,
"train_speed(iter/s)": 0.021382
},
{
"epoch": 0.09896490785155264,
"grad_norm": 5.920216083526611,
"learning_rate": 0.000196,
"logits/chosen": -0.744787335395813,
"logits/rejected": -0.7133767604827881,
"logps/chosen": -8.577417373657227,
"logps/rejected": -15.383255958557129,
"loss": 1.23928964138031,
"memory(GiB)": 41.88,
"nll_loss": 0.5441281199455261,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1016860231757164,
"rewards/margins": 0.13402265310287476,
"rewards/rejected": -0.23570865392684937,
"step": 49,
"train_speed(iter/s)": 0.021382
},
{
"epoch": 0.1009845998485231,
"grad_norm": 5.736071586608887,
"learning_rate": 0.0002,
"logits/chosen": -0.7741532325744629,
"logits/rejected": -0.8851832747459412,
"logps/chosen": -4.090970039367676,
"logps/rejected": -21.758840560913086,
"loss": 1.0278420448303223,
"memory(GiB)": 41.88,
"nll_loss": 0.5550558567047119,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.15652738511562347,
"rewards/margins": 0.8236760497093201,
"rewards/rejected": -0.6671487092971802,
"step": 50,
"train_speed(iter/s)": 0.021383
},
{
"epoch": 0.10300429184549356,
"grad_norm": 4.201787948608398,
"learning_rate": 0.0001999994415122672,
"logits/chosen": -0.8024938106536865,
"logits/rejected": -0.8299172520637512,
"logps/chosen": -6.9087419509887695,
"logps/rejected": -10.72697639465332,
"loss": 1.1162101030349731,
"memory(GiB)": 41.88,
"nll_loss": 0.4278947114944458,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.060360271483659744,
"rewards/margins": 0.15178537368774414,
"rewards/rejected": -0.0914250910282135,
"step": 51,
"train_speed(iter/s)": 0.021239
},
{
"epoch": 0.10502398384246403,
"grad_norm": 3.155092477798462,
"learning_rate": 0.0001999977660553069,
"logits/chosen": -0.6624072790145874,
"logits/rejected": -0.8125584125518799,
"logps/chosen": -1.1845072507858276,
"logps/rejected": -28.393592834472656,
"loss": 0.5598468780517578,
"memory(GiB)": 41.88,
"nll_loss": 0.15286707878112793,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2649957835674286,
"rewards/margins": 1.0407716035842896,
"rewards/rejected": -0.7757757902145386,
"step": 52,
"train_speed(iter/s)": 0.02124
},
{
"epoch": 0.10704367583943449,
"grad_norm": 3.9601948261260986,
"learning_rate": 0.0001999949736478336,
"logits/chosen": -0.8051952719688416,
"logits/rejected": -0.8654646873474121,
"logps/chosen": -3.793642997741699,
"logps/rejected": -17.214599609375,
"loss": 0.738736629486084,
"memory(GiB)": 41.88,
"nll_loss": 0.23666247725486755,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.17774169147014618,
"rewards/margins": 0.6443970799446106,
"rewards/rejected": -0.4666553735733032,
"step": 53,
"train_speed(iter/s)": 0.021244
},
{
"epoch": 0.10906336783640495,
"grad_norm": 2.747492790222168,
"learning_rate": 0.0001999910643210378,
"logits/chosen": -0.7448392510414124,
"logits/rejected": -0.9058634042739868,
"logps/chosen": -1.6127703189849854,
"logps/rejected": -30.806520462036133,
"loss": 0.5075910091400146,
"memory(GiB)": 41.88,
"nll_loss": 0.17231889069080353,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.4633626639842987,
"rewards/margins": 1.3208293914794922,
"rewards/rejected": -0.8574665784835815,
"step": 54,
"train_speed(iter/s)": 0.021246
},
{
"epoch": 0.11108305983337541,
"grad_norm": 3.485903739929199,
"learning_rate": 0.00019998603811858571,
"logits/chosen": -0.6839566230773926,
"logits/rejected": -0.8555458784103394,
"logps/chosen": -2.3723244667053223,
"logps/rejected": -34.97600173950195,
"loss": 0.7429671883583069,
"memory(GiB)": 41.88,
"nll_loss": 0.3656916618347168,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.24485386908054352,
"rewards/margins": 1.4793577194213867,
"rewards/rejected": -1.2345038652420044,
"step": 55,
"train_speed(iter/s)": 0.021247
},
{
"epoch": 0.11310275183034588,
"grad_norm": 4.815752029418945,
"learning_rate": 0.0001999798950966188,
"logits/chosen": -0.7993583679199219,
"logits/rejected": -0.8806532025337219,
"logps/chosen": -5.939935207366943,
"logps/rejected": -18.04892349243164,
"loss": 1.1477632522583008,
"memory(GiB)": 41.88,
"nll_loss": 0.5634173154830933,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.026777414605021477,
"rewards/margins": 0.612076461315155,
"rewards/rejected": -0.5852990746498108,
"step": 56,
"train_speed(iter/s)": 0.021251
},
{
"epoch": 0.11512244382731633,
"grad_norm": 2.9355173110961914,
"learning_rate": 0.00019997263532375303,
"logits/chosen": -0.7389899492263794,
"logits/rejected": -0.8667410612106323,
"logps/chosen": -2.2958154678344727,
"logps/rejected": -32.464534759521484,
"loss": 0.6630210876464844,
"memory(GiB)": 41.88,
"nll_loss": 0.3285917043685913,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1826460361480713,
"rewards/margins": 1.4345746040344238,
"rewards/rejected": -1.251928448677063,
"step": 57,
"train_speed(iter/s)": 0.021253
},
{
"epoch": 0.1171421358242868,
"grad_norm": 4.644790172576904,
"learning_rate": 0.0001999642588810784,
"logits/chosen": -0.8502639532089233,
"logits/rejected": -0.9041623473167419,
"logps/chosen": -4.175015449523926,
"logps/rejected": -20.228912353515625,
"loss": 1.007567048072815,
"memory(GiB)": 41.88,
"nll_loss": 0.4676174223423004,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.053391821682453156,
"rewards/margins": 0.8722233176231384,
"rewards/rejected": -0.925615131855011,
"step": 58,
"train_speed(iter/s)": 0.021258
},
{
"epoch": 0.11916182782125725,
"grad_norm": 4.834179878234863,
"learning_rate": 0.00019995476586215762,
"logits/chosen": -0.8684061169624329,
"logits/rejected": -0.9059044718742371,
"logps/chosen": -9.152887344360352,
"logps/rejected": -15.517383575439453,
"loss": 1.118729591369629,
"memory(GiB)": 41.88,
"nll_loss": 0.6267417073249817,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0668405294418335,
"rewards/margins": 0.7597751021385193,
"rewards/rejected": -0.6929346323013306,
"step": 59,
"train_speed(iter/s)": 0.021264
},
{
"epoch": 0.12118151981822772,
"grad_norm": 3.052858591079712,
"learning_rate": 0.00019994415637302547,
"logits/chosen": -0.7785470485687256,
"logits/rejected": -0.8464182019233704,
"logps/chosen": -2.411245107650757,
"logps/rejected": -17.925155639648438,
"loss": 0.7822959423065186,
"memory(GiB)": 41.88,
"nll_loss": 0.25340673327445984,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.19467662274837494,
"rewards/margins": 0.8461788892745972,
"rewards/rejected": -0.6515023112297058,
"step": 60,
"train_speed(iter/s)": 0.021268
},
{
"epoch": 0.12320121181519818,
"grad_norm": 3.3108043670654297,
"learning_rate": 0.0001999324305321873,
"logits/chosen": -0.762412428855896,
"logits/rejected": -0.8276241421699524,
"logps/chosen": -2.0741934776306152,
"logps/rejected": -14.743797302246094,
"loss": 0.8085264563560486,
"memory(GiB)": 41.88,
"nll_loss": 0.25528597831726074,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.13805074989795685,
"rewards/margins": 0.4351329803466797,
"rewards/rejected": -0.29708221554756165,
"step": 61,
"train_speed(iter/s)": 0.021273
},
{
"epoch": 0.12522090381216863,
"grad_norm": 3.6591594219207764,
"learning_rate": 0.00019991958847061784,
"logits/chosen": -0.6577974557876587,
"logits/rejected": -0.7462488412857056,
"logps/chosen": -5.370046138763428,
"logps/rejected": -15.76892375946045,
"loss": 0.9229806661605835,
"memory(GiB)": 41.88,
"nll_loss": 0.3679361343383789,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.14663854241371155,
"rewards/margins": 0.4843655228614807,
"rewards/rejected": -0.33772704005241394,
"step": 62,
"train_speed(iter/s)": 0.021275
},
{
"epoch": 0.1272405958091391,
"grad_norm": 3.069516658782959,
"learning_rate": 0.00019990563033175983,
"logits/chosen": -0.6640661954879761,
"logits/rejected": -0.7672103643417358,
"logps/chosen": -2.8094382286071777,
"logps/rejected": -18.480703353881836,
"loss": 0.7683196663856506,
"memory(GiB)": 41.88,
"nll_loss": 0.2581484913825989,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2657431662082672,
"rewards/margins": 0.5364934802055359,
"rewards/rejected": -0.27075034379959106,
"step": 63,
"train_speed(iter/s)": 0.021277
},
{
"epoch": 0.12926028780610957,
"grad_norm": 4.207716464996338,
"learning_rate": 0.0001998905562715222,
"logits/chosen": -0.7866019010543823,
"logits/rejected": -0.8437267541885376,
"logps/chosen": -6.750940799713135,
"logps/rejected": -15.358600616455078,
"loss": 1.2175216674804688,
"memory(GiB)": 41.88,
"nll_loss": 0.6082065105438232,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.004789266735315323,
"rewards/margins": 0.4517655074596405,
"rewards/rejected": -0.44697627425193787,
"step": 64,
"train_speed(iter/s)": 0.021281
},
{
"epoch": 0.13127997980308004,
"grad_norm": 2.928544282913208,
"learning_rate": 0.0001998743664582786,
"logits/chosen": -0.7847710251808167,
"logits/rejected": -0.8567973971366882,
"logps/chosen": -2.9689300060272217,
"logps/rejected": -19.40102767944336,
"loss": 0.9175847768783569,
"memory(GiB)": 41.88,
"nll_loss": 0.4591127634048462,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.08043977618217468,
"rewards/margins": 0.8204008340835571,
"rewards/rejected": -0.7399609088897705,
"step": 65,
"train_speed(iter/s)": 0.021285
},
{
"epoch": 0.13329967180005048,
"grad_norm": 3.2160611152648926,
"learning_rate": 0.00019985706107286514,
"logits/chosen": -0.737562358379364,
"logits/rejected": -0.8171918988227844,
"logps/chosen": -1.0520405769348145,
"logps/rejected": -13.78677749633789,
"loss": 0.6010702252388,
"memory(GiB)": 41.88,
"nll_loss": 0.1751595437526703,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.34129399061203003,
"rewards/margins": 0.7596877813339233,
"rewards/rejected": -0.41839370131492615,
"step": 66,
"train_speed(iter/s)": 0.021288
},
{
"epoch": 0.13531936379702095,
"grad_norm": 3.3036932945251465,
"learning_rate": 0.00019983864030857882,
"logits/chosen": -0.8425466418266296,
"logits/rejected": -0.8621857762336731,
"logps/chosen": -3.0595273971557617,
"logps/rejected": -10.996197700500488,
"loss": 0.8735880851745605,
"memory(GiB)": 41.88,
"nll_loss": 0.35458827018737793,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.18186795711517334,
"rewards/margins": 0.6314299702644348,
"rewards/rejected": -0.4495620131492615,
"step": 67,
"train_speed(iter/s)": 0.021292
},
{
"epoch": 0.13733905579399142,
"grad_norm": 4.266996383666992,
"learning_rate": 0.000199819104371175,
"logits/chosen": -0.780097246170044,
"logits/rejected": -0.8485308289527893,
"logps/chosen": -2.523211717605591,
"logps/rejected": -16.111953735351562,
"loss": 0.8541173934936523,
"memory(GiB)": 41.88,
"nll_loss": 0.3557310998439789,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.15383680164813995,
"rewards/margins": 0.7679665684700012,
"rewards/rejected": -0.6141297817230225,
"step": 68,
"train_speed(iter/s)": 0.021296
},
{
"epoch": 0.13935874779096188,
"grad_norm": 4.107142925262451,
"learning_rate": 0.0001997984534788654,
"logits/chosen": -0.8730877041816711,
"logits/rejected": -0.9365532398223877,
"logps/chosen": -3.6425538063049316,
"logps/rejected": -14.239816665649414,
"loss": 0.9654451608657837,
"memory(GiB)": 41.88,
"nll_loss": 0.5073843002319336,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.17483213543891907,
"rewards/margins": 0.7276958227157593,
"rewards/rejected": -0.5528636574745178,
"step": 69,
"train_speed(iter/s)": 0.021301
},
{
"epoch": 0.14137843978793235,
"grad_norm": 6.40019416809082,
"learning_rate": 0.00019977668786231534,
"logits/chosen": -0.8017210960388184,
"logits/rejected": -0.8579236268997192,
"logps/chosen": -3.737541437149048,
"logps/rejected": -21.258663177490234,
"loss": 0.9284271001815796,
"memory(GiB)": 41.88,
"nll_loss": 0.45301198959350586,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.02088707685470581,
"rewards/margins": 1.0906426906585693,
"rewards/rejected": -1.0697555541992188,
"step": 70,
"train_speed(iter/s)": 0.021303
},
{
"epoch": 0.1433981317849028,
"grad_norm": 2.583921432495117,
"learning_rate": 0.0001997538077646414,
"logits/chosen": -0.7329834699630737,
"logits/rejected": -0.8454375863075256,
"logps/chosen": -1.1047859191894531,
"logps/rejected": -17.00843620300293,
"loss": 0.5504162907600403,
"memory(GiB)": 41.88,
"nll_loss": 0.13712885975837708,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.37011057138442993,
"rewards/margins": 0.8445523381233215,
"rewards/rejected": -0.4744417369365692,
"step": 71,
"train_speed(iter/s)": 0.021305
},
{
"epoch": 0.14541782378187326,
"grad_norm": 2.9413509368896484,
"learning_rate": 0.00019972981344140874,
"logits/chosen": -0.7188448309898376,
"logits/rejected": -0.8286901116371155,
"logps/chosen": -2.631627321243286,
"logps/rejected": -22.459745407104492,
"loss": 0.7896307706832886,
"memory(GiB)": 41.88,
"nll_loss": 0.3527805805206299,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.12620781362056732,
"rewards/margins": 1.1612414121627808,
"rewards/rejected": -1.0350335836410522,
"step": 72,
"train_speed(iter/s)": 0.021307
},
{
"epoch": 0.14743751577884373,
"grad_norm": 3.0875403881073,
"learning_rate": 0.000199704705160628,
"logits/chosen": -0.7547197341918945,
"logits/rejected": -0.8351807594299316,
"logps/chosen": -5.00991153717041,
"logps/rejected": -30.629638671875,
"loss": 0.8512266874313354,
"memory(GiB)": 41.88,
"nll_loss": 0.39438357949256897,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1695525050163269,
"rewards/margins": 1.1737316846847534,
"rewards/rejected": -1.0041792392730713,
"step": 73,
"train_speed(iter/s)": 0.021308
},
{
"epoch": 0.1494572077758142,
"grad_norm": 3.0828444957733154,
"learning_rate": 0.0001996784832027525,
"logits/chosen": -0.7492446899414062,
"logits/rejected": -0.8275682926177979,
"logps/chosen": -3.108285903930664,
"logps/rejected": -18.224658966064453,
"loss": 0.7956384420394897,
"memory(GiB)": 41.88,
"nll_loss": 0.2778869569301605,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1457613706588745,
"rewards/margins": 0.7900225520133972,
"rewards/rejected": -0.6442610621452332,
"step": 74,
"train_speed(iter/s)": 0.021311
},
{
"epoch": 0.15147689977278464,
"grad_norm": 2.5818111896514893,
"learning_rate": 0.00019965114786067516,
"logits/chosen": -0.7824280858039856,
"logits/rejected": -0.8512482643127441,
"logps/chosen": -0.3878008723258972,
"logps/rejected": -19.119585037231445,
"loss": 0.3888098895549774,
"memory(GiB)": 41.88,
"nll_loss": 0.06809913367033005,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3290511965751648,
"rewards/margins": 1.1828463077545166,
"rewards/rejected": -0.853795051574707,
"step": 75,
"train_speed(iter/s)": 0.021315
},
{
"epoch": 0.1534965917697551,
"grad_norm": 3.1177899837493896,
"learning_rate": 0.000199622699439725,
"logits/chosen": -0.7851688861846924,
"logits/rejected": -0.8108853101730347,
"logps/chosen": -1.9916081428527832,
"logps/rejected": -18.17394256591797,
"loss": 0.6110791563987732,
"memory(GiB)": 41.88,
"nll_loss": 0.25529026985168457,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.44155535101890564,
"rewards/margins": 1.2954609394073486,
"rewards/rejected": -0.8539055585861206,
"step": 76,
"train_speed(iter/s)": 0.021318
},
{
"epoch": 0.15551628376672558,
"grad_norm": 4.25754976272583,
"learning_rate": 0.00019959313825766386,
"logits/chosen": -0.6911004185676575,
"logits/rejected": -0.7695882320404053,
"logps/chosen": -2.4477198123931885,
"logps/rejected": -31.02164077758789,
"loss": 0.7074019908905029,
"memory(GiB)": 41.88,
"nll_loss": 0.29494914412498474,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.19254879653453827,
"rewards/margins": 1.7098207473754883,
"rewards/rejected": -1.5172719955444336,
"step": 77,
"train_speed(iter/s)": 0.02132
},
{
"epoch": 0.15753597576369605,
"grad_norm": 7.972916603088379,
"learning_rate": 0.00019956246464468294,
"logits/chosen": -0.6392947435379028,
"logits/rejected": -0.7352097630500793,
"logps/chosen": -4.085236549377441,
"logps/rejected": -42.829315185546875,
"loss": 0.8604206442832947,
"memory(GiB)": 41.88,
"nll_loss": 0.34664490818977356,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.04581055790185928,
"rewards/margins": 1.8653144836425781,
"rewards/rejected": -1.9111250638961792,
"step": 78,
"train_speed(iter/s)": 0.021318
},
{
"epoch": 0.1595556677606665,
"grad_norm": 9.261566162109375,
"learning_rate": 0.00019953067894339896,
"logits/chosen": -0.7612121105194092,
"logits/rejected": -0.7584162950515747,
"logps/chosen": -22.329971313476562,
"logps/rejected": -21.844179153442383,
"loss": 1.6152374744415283,
"memory(GiB)": 41.88,
"nll_loss": 0.7144608497619629,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.5578466653823853,
"rewards/margins": 0.5714378952980042,
"rewards/rejected": -1.1292846202850342,
"step": 79,
"train_speed(iter/s)": 0.02132
},
{
"epoch": 0.16157535975763695,
"grad_norm": 2.517524242401123,
"learning_rate": 0.00019949778150885042,
"logits/chosen": -0.7058742046356201,
"logits/rejected": -0.8091444373130798,
"logps/chosen": -2.800210952758789,
"logps/rejected": -20.613197326660156,
"loss": 0.5419849157333374,
"memory(GiB)": 41.88,
"nll_loss": 0.18958702683448792,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1262124478816986,
"rewards/margins": 1.2596018314361572,
"rewards/rejected": -1.1333893537521362,
"step": 80,
"train_speed(iter/s)": 0.02132
},
{
"epoch": 0.16359505175460742,
"grad_norm": 2.3371551036834717,
"learning_rate": 0.00019946377270849356,
"logits/chosen": -0.6530874967575073,
"logits/rejected": -0.7903028130531311,
"logps/chosen": -1.8574573993682861,
"logps/rejected": -34.57234573364258,
"loss": 0.47842535376548767,
"memory(GiB)": 41.88,
"nll_loss": 0.20502685010433197,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21239632368087769,
"rewards/margins": 1.7234400510787964,
"rewards/rejected": -1.5110437870025635,
"step": 81,
"train_speed(iter/s)": 0.021321
},
{
"epoch": 0.1656147437515779,
"grad_norm": 2.623552083969116,
"learning_rate": 0.00019942865292219838,
"logits/chosen": -0.5469449162483215,
"logits/rejected": -0.7048972249031067,
"logps/chosen": -4.390412330627441,
"logps/rejected": -31.797592163085938,
"loss": 0.6188596487045288,
"memory(GiB)": 41.88,
"nll_loss": 0.28328126668930054,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1721397191286087,
"rewards/margins": 1.405639410018921,
"rewards/rejected": -1.2334996461868286,
"step": 82,
"train_speed(iter/s)": 0.02132
},
{
"epoch": 0.16763443574854833,
"grad_norm": 3.757638931274414,
"learning_rate": 0.00019939242254224423,
"logits/chosen": -0.7363824248313904,
"logits/rejected": -0.8039526343345642,
"logps/chosen": -4.921553134918213,
"logps/rejected": -18.160133361816406,
"loss": 1.017354965209961,
"memory(GiB)": 41.88,
"nll_loss": 0.4084692597389221,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.042609840631484985,
"rewards/margins": 0.6757681965827942,
"rewards/rejected": -0.7183780074119568,
"step": 83,
"train_speed(iter/s)": 0.021321
},
{
"epoch": 0.1696541277455188,
"grad_norm": 2.6959855556488037,
"learning_rate": 0.00019935508197331555,
"logits/chosen": -0.601901650428772,
"logits/rejected": -0.7518936395645142,
"logps/chosen": -2.1843678951263428,
"logps/rejected": -32.7392578125,
"loss": 0.5553274154663086,
"memory(GiB)": 41.88,
"nll_loss": 0.21038973331451416,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22294606268405914,
"rewards/margins": 1.4514588117599487,
"rewards/rejected": -1.2285128831863403,
"step": 84,
"train_speed(iter/s)": 0.02132
},
{
"epoch": 0.17167381974248927,
"grad_norm": 3.8080639839172363,
"learning_rate": 0.00019931663163249742,
"logits/chosen": -0.8070834875106812,
"logits/rejected": -0.8214148283004761,
"logps/chosen": -4.387559413909912,
"logps/rejected": -13.731513977050781,
"loss": 0.8594411611557007,
"memory(GiB)": 41.88,
"nll_loss": 0.2712303698062897,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.08239315450191498,
"rewards/margins": 0.5998476147651672,
"rewards/rejected": -0.5174545049667358,
"step": 85,
"train_speed(iter/s)": 0.021322
},
{
"epoch": 0.17369351173945974,
"grad_norm": 4.74073600769043,
"learning_rate": 0.00019927707194927066,
"logits/chosen": -0.770719051361084,
"logits/rejected": -0.802936315536499,
"logps/chosen": -3.8553550243377686,
"logps/rejected": -22.488487243652344,
"loss": 0.7815805077552795,
"memory(GiB)": 41.88,
"nll_loss": 0.432535856962204,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1827356368303299,
"rewards/margins": 1.2188729047775269,
"rewards/rejected": -1.0361372232437134,
"step": 86,
"train_speed(iter/s)": 0.021324
},
{
"epoch": 0.1757132037364302,
"grad_norm": 6.638978481292725,
"learning_rate": 0.0001992364033655072,
"logits/chosen": -0.6007230281829834,
"logits/rejected": -0.7821131944656372,
"logps/chosen": -0.698825478553772,
"logps/rejected": -31.5311279296875,
"loss": 0.4713582396507263,
"memory(GiB)": 41.88,
"nll_loss": 0.09712451696395874,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.23644955456256866,
"rewards/margins": 1.2481129169464111,
"rewards/rejected": -1.0116633176803589,
"step": 87,
"train_speed(iter/s)": 0.021324
},
{
"epoch": 0.17773289573340065,
"grad_norm": 5.0127739906311035,
"learning_rate": 0.00019919462633546519,
"logits/chosen": -0.7654692530632019,
"logits/rejected": -0.8514058589935303,
"logps/chosen": -4.281129837036133,
"logps/rejected": -17.92319107055664,
"loss": 1.0033936500549316,
"memory(GiB)": 41.88,
"nll_loss": 0.5217462182044983,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.14046959578990936,
"rewards/margins": 0.7611122131347656,
"rewards/rejected": -0.6206426620483398,
"step": 88,
"train_speed(iter/s)": 0.021326
},
{
"epoch": 0.17975258773037112,
"grad_norm": 5.285451889038086,
"learning_rate": 0.00019915174132578378,
"logits/chosen": -0.6645584106445312,
"logits/rejected": -0.789848804473877,
"logps/chosen": -5.77445650100708,
"logps/rejected": -37.78670883178711,
"loss": 0.6340041160583496,
"memory(GiB)": 41.88,
"nll_loss": 0.26252368092536926,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07033467292785645,
"rewards/margins": 1.5086185932159424,
"rewards/rejected": -1.4382836818695068,
"step": 89,
"train_speed(iter/s)": 0.021326
},
{
"epoch": 0.18177227972734158,
"grad_norm": 6.486772060394287,
"learning_rate": 0.000199107748815478,
"logits/chosen": -0.5895614624023438,
"logits/rejected": -0.7669257521629333,
"logps/chosen": -2.622659206390381,
"logps/rejected": -42.33251953125,
"loss": 0.7003304958343506,
"memory(GiB)": 45.64,
"nll_loss": 0.30153194069862366,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2086510956287384,
"rewards/margins": 1.978740930557251,
"rewards/rejected": -1.770089864730835,
"step": 90,
"train_speed(iter/s)": 0.021324
},
{
"epoch": 0.18379197172431205,
"grad_norm": 4.038703918457031,
"learning_rate": 0.00019906264929593347,
"logits/chosen": -0.6498143076896667,
"logits/rejected": -0.7417197823524475,
"logps/chosen": -6.643020153045654,
"logps/rejected": -26.659536361694336,
"loss": 0.5661642551422119,
"memory(GiB)": 45.64,
"nll_loss": 0.23169369995594025,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.25588488578796387,
"rewards/margins": 1.4719629287719727,
"rewards/rejected": -1.2160780429840088,
"step": 91,
"train_speed(iter/s)": 0.021323
},
{
"epoch": 0.1858116637212825,
"grad_norm": 2.8225672245025635,
"learning_rate": 0.00019901644327090064,
"logits/chosen": -0.7718486189842224,
"logits/rejected": -0.8817813992500305,
"logps/chosen": -2.4756038188934326,
"logps/rejected": -29.404544830322266,
"loss": 0.4890742599964142,
"memory(GiB)": 45.64,
"nll_loss": 0.24528944492340088,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2983011305332184,
"rewards/margins": 1.8501620292663574,
"rewards/rejected": -1.5518608093261719,
"step": 92,
"train_speed(iter/s)": 0.021325
},
{
"epoch": 0.18783135571825296,
"grad_norm": 7.307145595550537,
"learning_rate": 0.00019896913125648955,
"logits/chosen": -0.8246339559555054,
"logits/rejected": -0.8683527708053589,
"logps/chosen": -6.234779357910156,
"logps/rejected": -18.237667083740234,
"loss": 1.4174689054489136,
"memory(GiB)": 45.64,
"nll_loss": 0.7513330578804016,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1854678839445114,
"rewards/margins": 0.6419495940208435,
"rewards/rejected": -0.8274174332618713,
"step": 93,
"train_speed(iter/s)": 0.021328
},
{
"epoch": 0.18985104771522343,
"grad_norm": 5.936891078948975,
"learning_rate": 0.00019892071378116376,
"logits/chosen": -0.7434009313583374,
"logits/rejected": -0.8614495396614075,
"logps/chosen": -4.436880111694336,
"logps/rejected": -27.014469146728516,
"loss": 0.9648631811141968,
"memory(GiB)": 45.64,
"nll_loss": 0.44619184732437134,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.08920584619045258,
"rewards/margins": 1.2521498203277588,
"rewards/rejected": -1.341355562210083,
"step": 94,
"train_speed(iter/s)": 0.021331
},
{
"epoch": 0.1918707397121939,
"grad_norm": 11.764037132263184,
"learning_rate": 0.0001988711913857346,
"logits/chosen": -0.5709604024887085,
"logits/rejected": -0.7604628801345825,
"logps/chosen": -5.328193187713623,
"logps/rejected": -44.60304260253906,
"loss": 0.8271011114120483,
"memory(GiB)": 45.64,
"nll_loss": 0.5297277569770813,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.0564165934920311,
"rewards/margins": 2.2518301010131836,
"rewards/rejected": -2.3082468509674072,
"step": 95,
"train_speed(iter/s)": 0.021329
},
{
"epoch": 0.19389043170916434,
"grad_norm": 4.440858840942383,
"learning_rate": 0.00019882056462335512,
"logits/chosen": -0.716915488243103,
"logits/rejected": -0.8559072017669678,
"logps/chosen": -4.923259258270264,
"logps/rejected": -22.751483917236328,
"loss": 1.0631147623062134,
"memory(GiB)": 45.64,
"nll_loss": 0.5847352743148804,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.04070784151554108,
"rewards/margins": 0.9810720086097717,
"rewards/rejected": -0.9403641223907471,
"step": 96,
"train_speed(iter/s)": 0.021331
},
{
"epoch": 0.1959101237061348,
"grad_norm": 4.534213542938232,
"learning_rate": 0.00019876883405951377,
"logits/chosen": -0.7735016345977783,
"logits/rejected": -0.8521608114242554,
"logps/chosen": -2.242138147354126,
"logps/rejected": -16.696674346923828,
"loss": 0.8221019506454468,
"memory(GiB)": 45.64,
"nll_loss": 0.30803507566452026,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.23840653896331787,
"rewards/margins": 0.7663496732711792,
"rewards/rejected": -0.5279431939125061,
"step": 97,
"train_speed(iter/s)": 0.021332
},
{
"epoch": 0.19792981570310528,
"grad_norm": 6.823293685913086,
"learning_rate": 0.0001987160002720283,
"logits/chosen": -0.7845535278320312,
"logits/rejected": -0.8421120643615723,
"logps/chosen": -8.860337257385254,
"logps/rejected": -18.79197883605957,
"loss": 0.9576016068458557,
"memory(GiB)": 45.64,
"nll_loss": 0.476947546005249,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1753305345773697,
"rewards/margins": 1.0159931182861328,
"rewards/rejected": -0.8406625986099243,
"step": 98,
"train_speed(iter/s)": 0.021334
},
{
"epoch": 0.19994950770007575,
"grad_norm": 3.7400314807891846,
"learning_rate": 0.00019866206385103915,
"logits/chosen": -0.708592414855957,
"logits/rejected": -0.7664063572883606,
"logps/chosen": -5.081974983215332,
"logps/rejected": -16.826196670532227,
"loss": 1.022936224937439,
"memory(GiB)": 45.64,
"nll_loss": 0.4172855615615845,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.049844808876514435,
"rewards/margins": 0.2858249545097351,
"rewards/rejected": -0.23598016798496246,
"step": 99,
"train_speed(iter/s)": 0.021335
},
{
"epoch": 0.2019691996970462,
"grad_norm": 4.397147178649902,
"learning_rate": 0.00019860702539900287,
"logits/chosen": -0.5574980974197388,
"logits/rejected": -0.7396320700645447,
"logps/chosen": -2.61395001411438,
"logps/rejected": -33.31013107299805,
"loss": 0.8842970132827759,
"memory(GiB)": 45.64,
"nll_loss": 0.3539983034133911,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.06448046863079071,
"rewards/margins": 0.9230259656906128,
"rewards/rejected": -0.8585454225540161,
"step": 100,
"train_speed(iter/s)": 0.021334
},
{
"epoch": 0.20398889169401666,
"grad_norm": 3.6620795726776123,
"learning_rate": 0.0001985508855306855,
"logits/chosen": -0.7978264093399048,
"logits/rejected": -0.8318206667900085,
"logps/chosen": -3.0011239051818848,
"logps/rejected": -13.4129638671875,
"loss": 0.869354784488678,
"memory(GiB)": 45.64,
"nll_loss": 0.28029945492744446,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.17673368752002716,
"rewards/margins": 0.44924402236938477,
"rewards/rejected": -0.2725103795528412,
"step": 101,
"train_speed(iter/s)": 0.021264
},
{
"epoch": 0.20600858369098712,
"grad_norm": 2.9251015186309814,
"learning_rate": 0.00019849364487315558,
"logits/chosen": -0.6999006271362305,
"logits/rejected": -0.7932964563369751,
"logps/chosen": -4.888404369354248,
"logps/rejected": -15.926616668701172,
"loss": 0.9600812792778015,
"memory(GiB)": 45.64,
"nll_loss": 0.4099733531475067,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.16860802471637726,
"rewards/margins": 0.5318610668182373,
"rewards/rejected": -0.36325308680534363,
"step": 102,
"train_speed(iter/s)": 0.021266
},
{
"epoch": 0.2080282756879576,
"grad_norm": 3.172440767288208,
"learning_rate": 0.00019843530406577723,
"logits/chosen": -0.7246884107589722,
"logits/rejected": -0.7787467837333679,
"logps/chosen": -3.1632981300354004,
"logps/rejected": -21.545318603515625,
"loss": 0.7317727208137512,
"memory(GiB)": 45.64,
"nll_loss": 0.3409346342086792,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1461772322654724,
"rewards/margins": 1.200048565864563,
"rewards/rejected": -1.0538712739944458,
"step": 103,
"train_speed(iter/s)": 0.021268
},
{
"epoch": 0.21004796768492806,
"grad_norm": 3.71928334236145,
"learning_rate": 0.00019837586376020294,
"logits/chosen": -0.6723949313163757,
"logits/rejected": -0.7337789535522461,
"logps/chosen": -9.011453628540039,
"logps/rejected": -24.695667266845703,
"loss": 0.8767037987709045,
"memory(GiB)": 45.64,
"nll_loss": 0.40366095304489136,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.017453588545322418,
"rewards/margins": 1.022116780281067,
"rewards/rejected": -1.0395703315734863,
"step": 104,
"train_speed(iter/s)": 0.02127
},
{
"epoch": 0.2120676596818985,
"grad_norm": 2.393298625946045,
"learning_rate": 0.00019831532462036636,
"logits/chosen": -0.5787035226821899,
"logits/rejected": -0.7247171998023987,
"logps/chosen": -3.2338626384735107,
"logps/rejected": -30.85213851928711,
"loss": 0.5790133476257324,
"memory(GiB)": 45.64,
"nll_loss": 0.23591873049736023,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.273136168718338,
"rewards/margins": 1.4806981086730957,
"rewards/rejected": -1.2075618505477905,
"step": 105,
"train_speed(iter/s)": 0.02127
},
{
"epoch": 0.21408735167886897,
"grad_norm": 3.9807705879211426,
"learning_rate": 0.0001982536873224748,
"logits/chosen": -0.6726570129394531,
"logits/rejected": -0.7844520807266235,
"logps/chosen": -11.104076385498047,
"logps/rejected": -29.71591567993164,
"loss": 0.5819936990737915,
"memory(GiB)": 45.64,
"nll_loss": 0.16406820714473724,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07211651653051376,
"rewards/margins": 1.3368288278579712,
"rewards/rejected": -1.2647120952606201,
"step": 106,
"train_speed(iter/s)": 0.02127
},
{
"epoch": 0.21610704367583944,
"grad_norm": 14.505188941955566,
"learning_rate": 0.00019819095255500178,
"logits/chosen": -0.6649254560470581,
"logits/rejected": -0.7490218877792358,
"logps/chosen": -6.695674896240234,
"logps/rejected": -36.64976501464844,
"loss": 0.9944093227386475,
"memory(GiB)": 45.64,
"nll_loss": 0.5400701761245728,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.20841172337532043,
"rewards/margins": 1.6346428394317627,
"rewards/rejected": -1.4262311458587646,
"step": 107,
"train_speed(iter/s)": 0.02127
},
{
"epoch": 0.2181267356728099,
"grad_norm": 5.73347282409668,
"learning_rate": 0.00019812712101867922,
"logits/chosen": -0.7590409517288208,
"logits/rejected": -0.8766330480575562,
"logps/chosen": -1.7668696641921997,
"logps/rejected": -23.773542404174805,
"loss": 0.6851338744163513,
"memory(GiB)": 45.64,
"nll_loss": 0.25430163741111755,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.15534955263137817,
"rewards/margins": 1.3926160335540771,
"rewards/rejected": -1.2372663021087646,
"step": 108,
"train_speed(iter/s)": 0.021273
},
{
"epoch": 0.22014642766978035,
"grad_norm": 2.351529121398926,
"learning_rate": 0.00019806219342648977,
"logits/chosen": -0.7287034392356873,
"logits/rejected": -0.8862197995185852,
"logps/chosen": -0.5065869688987732,
"logps/rejected": -29.2410945892334,
"loss": 0.35556384921073914,
"memory(GiB)": 45.64,
"nll_loss": 0.10009891539812088,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.37776732444763184,
"rewards/margins": 1.7389698028564453,
"rewards/rejected": -1.361202597618103,
"step": 109,
"train_speed(iter/s)": 0.021275
},
{
"epoch": 0.22216611966675082,
"grad_norm": 4.292262077331543,
"learning_rate": 0.0001979961705036587,
"logits/chosen": -0.7477302551269531,
"logits/rejected": -0.8113406300544739,
"logps/chosen": -4.461059093475342,
"logps/rejected": -25.79521942138672,
"loss": 0.9549956321716309,
"memory(GiB)": 45.64,
"nll_loss": 0.4869251251220703,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.08557192981243134,
"rewards/margins": 1.1444835662841797,
"rewards/rejected": -1.2300554513931274,
"step": 110,
"train_speed(iter/s)": 0.021277
},
{
"epoch": 0.22418581166372128,
"grad_norm": 3.231773853302002,
"learning_rate": 0.0001979290529876458,
"logits/chosen": -0.6231730580329895,
"logits/rejected": -0.8174745440483093,
"logps/chosen": -0.6967498064041138,
"logps/rejected": -34.312564849853516,
"loss": 0.4151938259601593,
"memory(GiB)": 45.64,
"nll_loss": 0.14568573236465454,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3004146218299866,
"rewards/margins": 1.8394732475280762,
"rewards/rejected": -1.5390586853027344,
"step": 111,
"train_speed(iter/s)": 0.021277
},
{
"epoch": 0.22620550366069175,
"grad_norm": 17.476547241210938,
"learning_rate": 0.00019786084162813733,
"logits/chosen": -0.7515086531639099,
"logits/rejected": -0.8278781771659851,
"logps/chosen": -8.48164176940918,
"logps/rejected": -27.406028747558594,
"loss": 1.484164834022522,
"memory(GiB)": 45.64,
"nll_loss": 0.8838226795196533,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.3509487807750702,
"rewards/margins": 1.2049919366836548,
"rewards/rejected": -1.5559407472610474,
"step": 112,
"train_speed(iter/s)": 0.021279
},
{
"epoch": 0.2282251956576622,
"grad_norm": 4.023671627044678,
"learning_rate": 0.00019779153718703745,
"logits/chosen": -0.6617270708084106,
"logits/rejected": -0.8029566407203674,
"logps/chosen": -3.8847668170928955,
"logps/rejected": -29.473770141601562,
"loss": 0.8206814527511597,
"memory(GiB)": 45.64,
"nll_loss": 0.33473947644233704,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1446269452571869,
"rewards/margins": 1.4900355339050293,
"rewards/rejected": -1.3454086780548096,
"step": 113,
"train_speed(iter/s)": 0.02128
},
{
"epoch": 0.23024488765463266,
"grad_norm": 1.5781970024108887,
"learning_rate": 0.00019772114043845965,
"logits/chosen": -0.7092657089233398,
"logits/rejected": -0.8382660150527954,
"logps/chosen": -0.47141486406326294,
"logps/rejected": -40.95867919921875,
"loss": 0.3395133912563324,
"memory(GiB)": 45.64,
"nll_loss": 0.10217627137899399,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.24633201956748962,
"rewards/margins": 2.3744595050811768,
"rewards/rejected": -2.1281275749206543,
"step": 114,
"train_speed(iter/s)": 0.021281
},
{
"epoch": 0.23226457965160313,
"grad_norm": 3.4185638427734375,
"learning_rate": 0.00019764965216871846,
"logits/chosen": -0.6823985576629639,
"logits/rejected": -0.8108518123626709,
"logps/chosen": -3.519054412841797,
"logps/rejected": -34.14986038208008,
"loss": 0.6295965909957886,
"memory(GiB)": 45.64,
"nll_loss": 0.34174439311027527,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1087992712855339,
"rewards/margins": 1.8799338340759277,
"rewards/rejected": -1.7711347341537476,
"step": 115,
"train_speed(iter/s)": 0.021281
},
{
"epoch": 0.2342842716485736,
"grad_norm": 5.202569961547852,
"learning_rate": 0.00019757707317632028,
"logits/chosen": -0.7702198624610901,
"logits/rejected": -0.7985497117042542,
"logps/chosen": -8.110039710998535,
"logps/rejected": -23.981826782226562,
"loss": 0.9200264811515808,
"memory(GiB)": 45.64,
"nll_loss": 0.40714696049690247,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.011667863465845585,
"rewards/margins": 1.2929402589797974,
"rewards/rejected": -1.2812724113464355,
"step": 116,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.23630396364554407,
"grad_norm": 3.570646286010742,
"learning_rate": 0.0001975034042719546,
"logits/chosen": -0.6833267211914062,
"logits/rejected": -0.832187294960022,
"logps/chosen": -5.206616401672363,
"logps/rejected": -43.44145965576172,
"loss": 0.7497320175170898,
"memory(GiB)": 45.64,
"nll_loss": 0.4067853093147278,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1555595099925995,
"rewards/margins": 2.0963921546936035,
"rewards/rejected": -1.940832495689392,
"step": 117,
"train_speed(iter/s)": 0.021283
},
{
"epoch": 0.2383236556425145,
"grad_norm": 2.559943914413452,
"learning_rate": 0.0001974286462784851,
"logits/chosen": -0.7291467785835266,
"logits/rejected": -0.8261964321136475,
"logps/chosen": -1.4934219121932983,
"logps/rejected": -20.029233932495117,
"loss": 0.575518786907196,
"memory(GiB)": 45.64,
"nll_loss": 0.24626033008098602,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.35854265093803406,
"rewards/margins": 1.5817933082580566,
"rewards/rejected": -1.2232506275177002,
"step": 118,
"train_speed(iter/s)": 0.021285
},
{
"epoch": 0.24034334763948498,
"grad_norm": 8.765168190002441,
"learning_rate": 0.00019735280003094015,
"logits/chosen": -0.7664045095443726,
"logits/rejected": -0.8301156759262085,
"logps/chosen": -11.605274200439453,
"logps/rejected": -33.71162414550781,
"loss": 1.43560791015625,
"memory(GiB)": 45.64,
"nll_loss": 1.0074396133422852,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.5399270057678223,
"rewards/margins": 1.4373902082443237,
"rewards/rejected": -1.9773170948028564,
"step": 119,
"train_speed(iter/s)": 0.021287
},
{
"epoch": 0.24236303963645545,
"grad_norm": 4.5908522605896,
"learning_rate": 0.00019727586637650373,
"logits/chosen": -0.6932565569877625,
"logits/rejected": -0.7234666347503662,
"logps/chosen": -17.431007385253906,
"logps/rejected": -34.0074462890625,
"loss": 1.0241637229919434,
"memory(GiB)": 45.64,
"nll_loss": 0.6038533449172974,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.17532162368297577,
"rewards/margins": 1.6745084524154663,
"rewards/rejected": -1.849830150604248,
"step": 120,
"train_speed(iter/s)": 0.021287
},
{
"epoch": 0.24438273163342591,
"grad_norm": 4.291138648986816,
"learning_rate": 0.00019719784617450593,
"logits/chosen": -0.655267596244812,
"logits/rejected": -0.7929190993309021,
"logps/chosen": -6.5861992835998535,
"logps/rejected": -43.83182907104492,
"loss": 0.696444571018219,
"memory(GiB)": 45.64,
"nll_loss": 0.4287887215614319,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.015995100140571594,
"rewards/margins": 2.3263349533081055,
"rewards/rejected": -2.342329978942871,
"step": 121,
"train_speed(iter/s)": 0.021287
},
{
"epoch": 0.24640242363039636,
"grad_norm": 3.7837073802948,
"learning_rate": 0.0001971187402964132,
"logits/chosen": -0.6419543027877808,
"logits/rejected": -0.7936818599700928,
"logps/chosen": -5.325220108032227,
"logps/rejected": -35.03059768676758,
"loss": 0.760798990726471,
"memory(GiB)": 45.64,
"nll_loss": 0.4128337502479553,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.004157397896051407,
"rewards/margins": 1.6647117137908936,
"rewards/rejected": -1.6688693761825562,
"step": 122,
"train_speed(iter/s)": 0.021287
},
{
"epoch": 0.24842211562736682,
"grad_norm": 3.332064390182495,
"learning_rate": 0.00019703854962581884,
"logits/chosen": -0.767221987247467,
"logits/rejected": -0.8504694700241089,
"logps/chosen": -1.6606477499008179,
"logps/rejected": -30.287626266479492,
"loss": 0.5448625087738037,
"memory(GiB)": 45.64,
"nll_loss": 0.1951584815979004,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.18560823798179626,
"rewards/margins": 1.3272532224655151,
"rewards/rejected": -1.1416449546813965,
"step": 123,
"train_speed(iter/s)": 0.021289
},
{
"epoch": 0.25044180762433726,
"grad_norm": 2.538031816482544,
"learning_rate": 0.00019695727505843297,
"logits/chosen": -0.8040828704833984,
"logits/rejected": -0.8591914176940918,
"logps/chosen": -2.396242618560791,
"logps/rejected": -17.942195892333984,
"loss": 0.6009309887886047,
"memory(GiB)": 45.64,
"nll_loss": 0.1990574449300766,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.31234806776046753,
"rewards/margins": 0.9391263723373413,
"rewards/rejected": -0.6267784237861633,
"step": 124,
"train_speed(iter/s)": 0.021291
},
{
"epoch": 0.25246149962130776,
"grad_norm": 2.4364805221557617,
"learning_rate": 0.00019687491750207254,
"logits/chosen": -0.8258935213088989,
"logits/rejected": -0.8962618112564087,
"logps/chosen": -1.0966453552246094,
"logps/rejected": -16.684877395629883,
"loss": 0.6394660472869873,
"memory(GiB)": 45.64,
"nll_loss": 0.15617281198501587,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2913311719894409,
"rewards/margins": 0.7776257395744324,
"rewards/rejected": -0.48629459738731384,
"step": 125,
"train_speed(iter/s)": 0.021292
},
{
"epoch": 0.2544811916182782,
"grad_norm": 4.309374809265137,
"learning_rate": 0.00019679147787665126,
"logits/chosen": -0.7291491627693176,
"logits/rejected": -0.8647027611732483,
"logps/chosen": -2.546858549118042,
"logps/rejected": -25.51129150390625,
"loss": 0.7438904047012329,
"memory(GiB)": 45.64,
"nll_loss": 0.29447755217552185,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24194566905498505,
"rewards/margins": 0.7109313607215881,
"rewards/rejected": -0.4689857065677643,
"step": 126,
"train_speed(iter/s)": 0.021292
},
{
"epoch": 0.2565008836152487,
"grad_norm": 3.316589117050171,
"learning_rate": 0.00019670695711416928,
"logits/chosen": -0.7973051071166992,
"logits/rejected": -0.9037990570068359,
"logps/chosen": -1.6116214990615845,
"logps/rejected": -24.904531478881836,
"loss": 0.4576399624347687,
"memory(GiB)": 45.64,
"nll_loss": 0.17375069856643677,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22464421391487122,
"rewards/margins": 1.4565354585647583,
"rewards/rejected": -1.2318912744522095,
"step": 127,
"train_speed(iter/s)": 0.021294
},
{
"epoch": 0.25852057561221914,
"grad_norm": 4.841390132904053,
"learning_rate": 0.00019662135615870275,
"logits/chosen": -0.7546025514602661,
"logits/rejected": -0.9116957187652588,
"logps/chosen": -2.7441368103027344,
"logps/rejected": -25.96759796142578,
"loss": 0.8130377531051636,
"memory(GiB)": 45.64,
"nll_loss": 0.3844357430934906,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.1914481222629547,
"rewards/margins": 1.4247140884399414,
"rewards/rejected": -1.2332658767700195,
"step": 128,
"train_speed(iter/s)": 0.021295
},
{
"epoch": 0.2605402676091896,
"grad_norm": 6.839901447296143,
"learning_rate": 0.0001965346759663934,
"logits/chosen": -0.6810730695724487,
"logits/rejected": -0.8468779921531677,
"logps/chosen": -5.32491397857666,
"logps/rejected": -42.42945861816406,
"loss": 1.0299216508865356,
"memory(GiB)": 45.64,
"nll_loss": 0.6279267072677612,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.009131789207458496,
"rewards/margins": 1.819998025894165,
"rewards/rejected": -1.829129934310913,
"step": 129,
"train_speed(iter/s)": 0.021294
},
{
"epoch": 0.2625599596061601,
"grad_norm": 2.0061724185943604,
"learning_rate": 0.00019644691750543767,
"logits/chosen": -0.8441457152366638,
"logits/rejected": -0.9423956274986267,
"logps/chosen": -0.5530110597610474,
"logps/rejected": -32.842193603515625,
"loss": 0.25913411378860474,
"memory(GiB)": 45.64,
"nll_loss": 0.05609491094946861,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27188676595687866,
"rewards/margins": 2.330637216567993,
"rewards/rejected": -2.0587503910064697,
"step": 130,
"train_speed(iter/s)": 0.021295
},
{
"epoch": 0.2645796516031305,
"grad_norm": 4.784903526306152,
"learning_rate": 0.00019635808175607605,
"logits/chosen": -0.8365444540977478,
"logits/rejected": -0.9138449430465698,
"logps/chosen": -3.4112894535064697,
"logps/rejected": -23.938806533813477,
"loss": 0.7469592094421387,
"memory(GiB)": 45.64,
"nll_loss": 0.31692469120025635,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09105291962623596,
"rewards/margins": 1.37967050075531,
"rewards/rejected": -1.288617730140686,
"step": 131,
"train_speed(iter/s)": 0.021296
},
{
"epoch": 0.26659934360010096,
"grad_norm": 9.284527778625488,
"learning_rate": 0.00019626816971058205,
"logits/chosen": -0.8304141759872437,
"logits/rejected": -0.9100163578987122,
"logps/chosen": -3.7839527130126953,
"logps/rejected": -18.869930267333984,
"loss": 1.1523946523666382,
"memory(GiB)": 45.64,
"nll_loss": 0.6580032706260681,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.240356907248497,
"rewards/margins": 1.1313059329986572,
"rewards/rejected": -0.890949010848999,
"step": 132,
"train_speed(iter/s)": 0.021298
},
{
"epoch": 0.26861903559707145,
"grad_norm": 4.299342632293701,
"learning_rate": 0.00019617718237325115,
"logits/chosen": -0.6347696781158447,
"logits/rejected": -0.7560770511627197,
"logps/chosen": -3.5856218338012695,
"logps/rejected": -30.4008846282959,
"loss": 0.739059567451477,
"memory(GiB)": 45.64,
"nll_loss": 0.38467657566070557,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.13314950466156006,
"rewards/margins": 1.3657082319259644,
"rewards/rejected": -1.2325587272644043,
"step": 133,
"train_speed(iter/s)": 0.021298
},
{
"epoch": 0.2706387275940419,
"grad_norm": 4.246809482574463,
"learning_rate": 0.00019608512076038962,
"logits/chosen": -0.7022749781608582,
"logits/rejected": -0.7915350794792175,
"logps/chosen": -4.822379112243652,
"logps/rejected": -24.07721710205078,
"loss": 0.8055979609489441,
"memory(GiB)": 45.64,
"nll_loss": 0.3307011127471924,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.11167091131210327,
"rewards/margins": 1.3118420839309692,
"rewards/rejected": -1.2001712322235107,
"step": 134,
"train_speed(iter/s)": 0.021298
},
{
"epoch": 0.2726584195910124,
"grad_norm": 2.9997761249542236,
"learning_rate": 0.0001959919859003031,
"logits/chosen": -0.6153374910354614,
"logits/rejected": -0.7747887969017029,
"logps/chosen": -0.7465253472328186,
"logps/rejected": -28.333953857421875,
"loss": 0.5413554906845093,
"memory(GiB)": 45.64,
"nll_loss": 0.14097237586975098,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.33766934275627136,
"rewards/margins": 0.9080523252487183,
"rewards/rejected": -0.5703830718994141,
"step": 135,
"train_speed(iter/s)": 0.021296
},
{
"epoch": 0.27467811158798283,
"grad_norm": 3.5653076171875,
"learning_rate": 0.00019589777883328505,
"logits/chosen": -0.7418694496154785,
"logits/rejected": -0.8762567043304443,
"logps/chosen": -1.4205451011657715,
"logps/rejected": -21.64703941345215,
"loss": 0.6491340398788452,
"memory(GiB)": 45.64,
"nll_loss": 0.16818463802337646,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2140020728111267,
"rewards/margins": 0.9494506120681763,
"rewards/rejected": -0.7354484796524048,
"step": 136,
"train_speed(iter/s)": 0.021298
},
{
"epoch": 0.2766978035849533,
"grad_norm": 2.6075761318206787,
"learning_rate": 0.00019580250061160539,
"logits/chosen": -0.5225172638893127,
"logits/rejected": -0.7319562435150146,
"logps/chosen": -2.6468346118927,
"logps/rejected": -41.52344512939453,
"loss": 0.5949529409408569,
"memory(GiB)": 45.64,
"nll_loss": 0.19340890645980835,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2633662819862366,
"rewards/margins": 1.1732457876205444,
"rewards/rejected": -0.9098795056343079,
"step": 137,
"train_speed(iter/s)": 0.021297
},
{
"epoch": 0.27871749558192377,
"grad_norm": 3.9614176750183105,
"learning_rate": 0.00019570615229949842,
"logits/chosen": -0.636820375919342,
"logits/rejected": -0.7707249522209167,
"logps/chosen": -3.3777596950531006,
"logps/rejected": -26.16946029663086,
"loss": 0.758621335029602,
"memory(GiB)": 45.64,
"nll_loss": 0.3399200439453125,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.15843479335308075,
"rewards/margins": 0.947920024394989,
"rewards/rejected": -0.7894852161407471,
"step": 138,
"train_speed(iter/s)": 0.021297
},
{
"epoch": 0.2807371875788942,
"grad_norm": 2.576108455657959,
"learning_rate": 0.00019560873497315116,
"logits/chosen": -0.6899356842041016,
"logits/rejected": -0.7887363433837891,
"logps/chosen": -1.9815049171447754,
"logps/rejected": -15.912079811096191,
"loss": 0.7393437623977661,
"memory(GiB)": 45.64,
"nll_loss": 0.24023714661598206,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.33446478843688965,
"rewards/margins": 0.6615203619003296,
"rewards/rejected": -0.32705551385879517,
"step": 139,
"train_speed(iter/s)": 0.021298
},
{
"epoch": 0.2827568795758647,
"grad_norm": 3.3134891986846924,
"learning_rate": 0.00019551024972069126,
"logits/chosen": -0.8353362679481506,
"logits/rejected": -0.8483090996742249,
"logps/chosen": -1.7245616912841797,
"logps/rejected": -15.235477447509766,
"loss": 0.5436122417449951,
"memory(GiB)": 45.64,
"nll_loss": 0.1701793223619461,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3035600185394287,
"rewards/margins": 1.1392890214920044,
"rewards/rejected": -0.8357290029525757,
"step": 140,
"train_speed(iter/s)": 0.021301
},
{
"epoch": 0.28477657157283515,
"grad_norm": 4.701112270355225,
"learning_rate": 0.0001954106976421748,
"logits/chosen": -0.7467123866081238,
"logits/rejected": -0.742473840713501,
"logps/chosen": -7.344741344451904,
"logps/rejected": -13.826343536376953,
"loss": 1.0974572896957397,
"memory(GiB)": 45.64,
"nll_loss": 0.45263901352882385,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.08538863807916641,
"rewards/margins": 0.4929981231689453,
"rewards/rejected": -0.5783867835998535,
"step": 141,
"train_speed(iter/s)": 0.021302
},
{
"epoch": 0.2867962635698056,
"grad_norm": 2.704679012298584,
"learning_rate": 0.00019531007984957408,
"logits/chosen": -0.5686406493186951,
"logits/rejected": -0.7427109479904175,
"logps/chosen": -2.140307664871216,
"logps/rejected": -37.99428939819336,
"loss": 0.5559962391853333,
"memory(GiB)": 45.64,
"nll_loss": 0.15430670976638794,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3728140592575073,
"rewards/margins": 2.170938730239868,
"rewards/rejected": -1.7981246709823608,
"step": 142,
"train_speed(iter/s)": 0.021302
},
{
"epoch": 0.2888159555667761,
"grad_norm": 6.6994123458862305,
"learning_rate": 0.0001952083974667652,
"logits/chosen": -0.6588355898857117,
"logits/rejected": -0.7316503524780273,
"logps/chosen": -7.539848804473877,
"logps/rejected": -26.308818817138672,
"loss": 1.176750659942627,
"memory(GiB)": 45.64,
"nll_loss": 0.5222424268722534,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.17204269766807556,
"rewards/margins": 0.8352524042129517,
"rewards/rejected": -1.0072951316833496,
"step": 143,
"train_speed(iter/s)": 0.021302
},
{
"epoch": 0.2908356475637465,
"grad_norm": 5.0174384117126465,
"learning_rate": 0.00019510565162951537,
"logits/chosen": -0.720901608467102,
"logits/rejected": -0.7480478882789612,
"logps/chosen": -6.40681266784668,
"logps/rejected": -27.90705680847168,
"loss": 0.6913059949874878,
"memory(GiB)": 45.64,
"nll_loss": 0.3720777928829193,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31874871253967285,
"rewards/margins": 2.0500223636627197,
"rewards/rejected": -1.7312736511230469,
"step": 144,
"train_speed(iter/s)": 0.021303
},
{
"epoch": 0.29285533956071697,
"grad_norm": 6.825158596038818,
"learning_rate": 0.00019500184348547042,
"logits/chosen": -0.7821186780929565,
"logits/rejected": -0.8765726685523987,
"logps/chosen": -3.37898588180542,
"logps/rejected": -19.76290512084961,
"loss": 0.8391829133033752,
"memory(GiB)": 45.64,
"nll_loss": 0.339937299489975,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.13619036972522736,
"rewards/margins": 1.1103405952453613,
"rewards/rejected": -0.9741502404212952,
"step": 145,
"train_speed(iter/s)": 0.021304
},
{
"epoch": 0.29487503155768746,
"grad_norm": 2.3948497772216797,
"learning_rate": 0.00019489697419414182,
"logits/chosen": -0.8977736830711365,
"logits/rejected": -0.954646110534668,
"logps/chosen": -1.5781641006469727,
"logps/rejected": -27.0587100982666,
"loss": 0.4295532703399658,
"memory(GiB)": 45.64,
"nll_loss": 0.1162162497639656,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24644073843955994,
"rewards/margins": 1.8821758031845093,
"rewards/rejected": -1.6357351541519165,
"step": 146,
"train_speed(iter/s)": 0.021306
},
{
"epoch": 0.2968947235546579,
"grad_norm": 6.068948268890381,
"learning_rate": 0.00019479104492689384,
"logits/chosen": -0.7972388863563538,
"logits/rejected": -0.9000754356384277,
"logps/chosen": -8.90436840057373,
"logps/rejected": -43.9642448425293,
"loss": 1.004248023033142,
"memory(GiB)": 45.64,
"nll_loss": 0.7405007481575012,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.2410261034965515,
"rewards/margins": 2.683554172515869,
"rewards/rejected": -2.9245800971984863,
"step": 147,
"train_speed(iter/s)": 0.021307
},
{
"epoch": 0.2989144155516284,
"grad_norm": 6.354671478271484,
"learning_rate": 0.00019468405686693044,
"logits/chosen": -0.8239361643791199,
"logits/rejected": -0.8870259523391724,
"logps/chosen": -3.0636796951293945,
"logps/rejected": -32.0543327331543,
"loss": 0.6938296556472778,
"memory(GiB)": 45.64,
"nll_loss": 0.32726508378982544,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2392302304506302,
"rewards/margins": 2.2771260738372803,
"rewards/rejected": -2.037895917892456,
"step": 148,
"train_speed(iter/s)": 0.021309
},
{
"epoch": 0.30093410754859884,
"grad_norm": 2.746241331100464,
"learning_rate": 0.00019457601120928194,
"logits/chosen": -0.7442300915718079,
"logits/rejected": -0.8740307092666626,
"logps/chosen": -0.39770960807800293,
"logps/rejected": -24.435047149658203,
"loss": 0.323159396648407,
"memory(GiB)": 45.64,
"nll_loss": 0.05953114107251167,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28615039587020874,
"rewards/margins": 1.8557114601135254,
"rewards/rejected": -1.5695610046386719,
"step": 149,
"train_speed(iter/s)": 0.02131
},
{
"epoch": 0.3029537995455693,
"grad_norm": 7.339154243469238,
"learning_rate": 0.0001944669091607919,
"logits/chosen": -0.7669613361358643,
"logits/rejected": -0.8887062072753906,
"logps/chosen": -6.112335205078125,
"logps/rejected": -46.467247009277344,
"loss": 0.7917571663856506,
"memory(GiB)": 45.64,
"nll_loss": 0.44829899072647095,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.07194096595048904,
"rewards/margins": 2.9925551414489746,
"rewards/rejected": -3.0644962787628174,
"step": 150,
"train_speed(iter/s)": 0.02131
},
{
"epoch": 0.3049734915425398,
"grad_norm": 13.051281929016113,
"learning_rate": 0.00019435675194010336,
"logits/chosen": -0.8439881801605225,
"logits/rejected": -0.93268883228302,
"logps/chosen": -4.412451267242432,
"logps/rejected": -46.751976013183594,
"loss": 0.8531545400619507,
"memory(GiB)": 45.64,
"nll_loss": 0.44560468196868896,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.06836838275194168,
"rewards/margins": 3.4782376289367676,
"rewards/rejected": -3.5466065406799316,
"step": 151,
"train_speed(iter/s)": 0.021262
},
{
"epoch": 0.3069931835395102,
"grad_norm": 3.5028750896453857,
"learning_rate": 0.00019424554077764546,
"logits/chosen": -0.7861919403076172,
"logits/rejected": -0.915184497833252,
"logps/chosen": -2.617560386657715,
"logps/rejected": -56.570960998535156,
"loss": 0.4112832546234131,
"memory(GiB)": 45.64,
"nll_loss": 0.2496473491191864,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.11519647389650345,
"rewards/margins": 3.7134275436401367,
"rewards/rejected": -3.598231315612793,
"step": 152,
"train_speed(iter/s)": 0.021263
},
{
"epoch": 0.3090128755364807,
"grad_norm": 6.6451520919799805,
"learning_rate": 0.00019413327691561967,
"logits/chosen": -0.7669755816459656,
"logits/rejected": -0.8034001588821411,
"logps/chosen": -9.02087688446045,
"logps/rejected": -36.971290588378906,
"loss": 0.8952721357345581,
"memory(GiB)": 45.64,
"nll_loss": 0.42217180132865906,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.07903412729501724,
"rewards/margins": 2.4241135120391846,
"rewards/rejected": -2.503147602081299,
"step": 153,
"train_speed(iter/s)": 0.021263
},
{
"epoch": 0.31103256753345115,
"grad_norm": 6.9827470779418945,
"learning_rate": 0.00019401996160798573,
"logits/chosen": -0.7891846895217896,
"logits/rejected": -0.8431411981582642,
"logps/chosen": -12.274852752685547,
"logps/rejected": -40.9384765625,
"loss": 1.0033327341079712,
"memory(GiB)": 45.64,
"nll_loss": 0.5167030692100525,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.11504307389259338,
"rewards/margins": 2.439614772796631,
"rewards/rejected": -2.5546579360961914,
"step": 154,
"train_speed(iter/s)": 0.021263
},
{
"epoch": 0.3130522595304216,
"grad_norm": 5.614060878753662,
"learning_rate": 0.0001939055961204478,
"logits/chosen": -0.8796770572662354,
"logits/rejected": -0.9147617816925049,
"logps/chosen": -7.191051959991455,
"logps/rejected": -29.8262882232666,
"loss": 0.8995785117149353,
"memory(GiB)": 45.64,
"nll_loss": 0.49978020787239075,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.055766861885786057,
"rewards/margins": 1.4225391149520874,
"rewards/rejected": -1.4783059358596802,
"step": 155,
"train_speed(iter/s)": 0.021264
},
{
"epoch": 0.3150719515273921,
"grad_norm": 5.3426737785339355,
"learning_rate": 0.00019379018173044037,
"logits/chosen": -0.8801127076148987,
"logits/rejected": -0.9478501081466675,
"logps/chosen": -5.170099258422852,
"logps/rejected": -29.119112014770508,
"loss": 0.7686877846717834,
"memory(GiB)": 45.64,
"nll_loss": 0.36578065156936646,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10118754208087921,
"rewards/margins": 1.4974370002746582,
"rewards/rejected": -1.3962492942810059,
"step": 156,
"train_speed(iter/s)": 0.021265
},
{
"epoch": 0.31709164352436253,
"grad_norm": 6.185426235198975,
"learning_rate": 0.00019367371972711385,
"logits/chosen": -0.883526623249054,
"logits/rejected": -0.9433069229125977,
"logps/chosen": -2.170651435852051,
"logps/rejected": -28.505441665649414,
"loss": 0.7070222496986389,
"memory(GiB)": 45.64,
"nll_loss": 0.333578884601593,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.17996083199977875,
"rewards/margins": 1.5758326053619385,
"rewards/rejected": -1.395871639251709,
"step": 157,
"train_speed(iter/s)": 0.021265
},
{
"epoch": 0.319111335521333,
"grad_norm": 4.604299068450928,
"learning_rate": 0.0001935562114113202,
"logits/chosen": -0.874811053276062,
"logits/rejected": -0.9069212079048157,
"logps/chosen": -6.411377906799316,
"logps/rejected": -28.813356399536133,
"loss": 0.8389774560928345,
"memory(GiB)": 45.64,
"nll_loss": 0.4572408199310303,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1476302295923233,
"rewards/margins": 1.0184513330459595,
"rewards/rejected": -0.8708210587501526,
"step": 158,
"train_speed(iter/s)": 0.021266
},
{
"epoch": 0.32113102751830347,
"grad_norm": 2.668325424194336,
"learning_rate": 0.00019343765809559852,
"logits/chosen": -0.9191151261329651,
"logits/rejected": -0.9647189378738403,
"logps/chosen": -2.182382106781006,
"logps/rejected": -27.029888153076172,
"loss": 0.6324246525764465,
"memory(GiB)": 45.64,
"nll_loss": 0.3407551646232605,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.22473560273647308,
"rewards/margins": 1.382723093032837,
"rewards/rejected": -1.1579875946044922,
"step": 159,
"train_speed(iter/s)": 0.021266
},
{
"epoch": 0.3231507195152739,
"grad_norm": 3.9123880863189697,
"learning_rate": 0.00019331806110416027,
"logits/chosen": -0.9419438242912292,
"logits/rejected": -0.9589441418647766,
"logps/chosen": -2.685596466064453,
"logps/rejected": -16.038766860961914,
"loss": 0.8650633692741394,
"memory(GiB)": 45.64,
"nll_loss": 0.3469831943511963,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12647470831871033,
"rewards/margins": 0.6830577254295349,
"rewards/rejected": -0.5565829873085022,
"step": 160,
"train_speed(iter/s)": 0.021268
},
{
"epoch": 0.3251704115122444,
"grad_norm": 3.562811851501465,
"learning_rate": 0.00019319742177287448,
"logits/chosen": -0.895343542098999,
"logits/rejected": -0.9661368727684021,
"logps/chosen": -3.5327184200286865,
"logps/rejected": -20.103837966918945,
"loss": 0.8163770437240601,
"memory(GiB)": 45.64,
"nll_loss": 0.42449474334716797,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2701226472854614,
"rewards/margins": 1.0340347290039062,
"rewards/rejected": -0.7639120221138,
"step": 161,
"train_speed(iter/s)": 0.02127
},
{
"epoch": 0.32719010350921485,
"grad_norm": 6.563948631286621,
"learning_rate": 0.00019307574144925287,
"logits/chosen": -0.9778874516487122,
"logits/rejected": -1.0073670148849487,
"logps/chosen": -2.233975887298584,
"logps/rejected": -14.128082275390625,
"loss": 0.8808709979057312,
"memory(GiB)": 45.64,
"nll_loss": 0.3910011947154999,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16543619334697723,
"rewards/margins": 0.6482046246528625,
"rewards/rejected": -0.48276838660240173,
"step": 162,
"train_speed(iter/s)": 0.021272
},
{
"epoch": 0.3292097955061853,
"grad_norm": 2.812866449356079,
"learning_rate": 0.0001929530214924348,
"logits/chosen": -0.8719493746757507,
"logits/rejected": -0.9090234041213989,
"logps/chosen": -2.135589361190796,
"logps/rejected": -34.29349136352539,
"loss": 0.6473661661148071,
"memory(GiB)": 45.64,
"nll_loss": 0.23261404037475586,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12609758973121643,
"rewards/margins": 1.2335658073425293,
"rewards/rejected": -1.1074683666229248,
"step": 163,
"train_speed(iter/s)": 0.021271
},
{
"epoch": 0.3312294875031558,
"grad_norm": 6.056075096130371,
"learning_rate": 0.0001928292632731721,
"logits/chosen": -0.927330732345581,
"logits/rejected": -0.9583979845046997,
"logps/chosen": -2.9721577167510986,
"logps/rejected": -37.22073745727539,
"loss": 0.5903728604316711,
"memory(GiB)": 45.64,
"nll_loss": 0.22814247012138367,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24338555335998535,
"rewards/margins": 1.3612616062164307,
"rewards/rejected": -1.1178761720657349,
"step": 164,
"train_speed(iter/s)": 0.021271
},
{
"epoch": 0.3332491795001262,
"grad_norm": 3.5847744941711426,
"learning_rate": 0.00019270446817381377,
"logits/chosen": -0.9705857038497925,
"logits/rejected": -0.9790812134742737,
"logps/chosen": -2.228187084197998,
"logps/rejected": -22.54074478149414,
"loss": 0.582669198513031,
"memory(GiB)": 45.64,
"nll_loss": 0.3219188451766968,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.31063607335090637,
"rewards/margins": 1.6680660247802734,
"rewards/rejected": -1.3574302196502686,
"step": 165,
"train_speed(iter/s)": 0.021273
},
{
"epoch": 0.33526887149709667,
"grad_norm": 3.5586040019989014,
"learning_rate": 0.00019257863758829035,
"logits/chosen": -0.9236764311790466,
"logits/rejected": -0.9713916182518005,
"logps/chosen": -2.841557264328003,
"logps/rejected": -41.60185241699219,
"loss": 0.667453408241272,
"memory(GiB)": 45.64,
"nll_loss": 0.45156461000442505,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1021651178598404,
"rewards/margins": 2.591975450515747,
"rewards/rejected": -2.4898104667663574,
"step": 166,
"train_speed(iter/s)": 0.021274
},
{
"epoch": 0.33728856349406716,
"grad_norm": 11.787897109985352,
"learning_rate": 0.00019245177292209867,
"logits/chosen": -0.9395866394042969,
"logits/rejected": -0.9611519575119019,
"logps/chosen": -5.94741153717041,
"logps/rejected": -48.858680725097656,
"loss": 1.042246699333191,
"memory(GiB)": 45.64,
"nll_loss": 0.6328973174095154,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.07254321873188019,
"rewards/margins": 2.8825278282165527,
"rewards/rejected": -2.955070734024048,
"step": 167,
"train_speed(iter/s)": 0.021274
},
{
"epoch": 0.3393082554910376,
"grad_norm": 2.1068975925445557,
"learning_rate": 0.00019232387559228587,
"logits/chosen": -0.9090099930763245,
"logits/rejected": -0.9743850827217102,
"logps/chosen": -3.3460116386413574,
"logps/rejected": -49.71737289428711,
"loss": 0.3520747423171997,
"memory(GiB)": 45.64,
"nll_loss": 0.20601019263267517,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.022673189640045166,
"rewards/margins": 3.1425955295562744,
"rewards/rejected": -3.165269136428833,
"step": 168,
"train_speed(iter/s)": 0.021274
},
{
"epoch": 0.3413279474880081,
"grad_norm": 13.362913131713867,
"learning_rate": 0.0001921949470274338,
"logits/chosen": -0.9718740582466125,
"logits/rejected": -0.9933693408966064,
"logps/chosen": -16.02916717529297,
"logps/rejected": -40.69719696044922,
"loss": 1.3985366821289062,
"memory(GiB)": 45.64,
"nll_loss": 1.129913330078125,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.9396551847457886,
"rewards/margins": 1.5676053762435913,
"rewards/rejected": -2.507260799407959,
"step": 169,
"train_speed(iter/s)": 0.021275
},
{
"epoch": 0.34334763948497854,
"grad_norm": 12.149360656738281,
"learning_rate": 0.00019206498866764288,
"logits/chosen": -0.9391348361968994,
"logits/rejected": -0.9958175420761108,
"logps/chosen": -4.999204635620117,
"logps/rejected": -34.91378402709961,
"loss": 1.1959863901138306,
"memory(GiB)": 45.64,
"nll_loss": 0.683914303779602,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1860208809375763,
"rewards/margins": 2.0848278999328613,
"rewards/rejected": -2.2708487510681152,
"step": 170,
"train_speed(iter/s)": 0.021276
},
{
"epoch": 0.345367331481949,
"grad_norm": 4.593865871429443,
"learning_rate": 0.0001919340019645161,
"logits/chosen": -0.8601446151733398,
"logits/rejected": -0.9445533752441406,
"logps/chosen": -6.576286792755127,
"logps/rejected": -35.74972152709961,
"loss": 0.8745996952056885,
"memory(GiB)": 45.64,
"nll_loss": 0.48976749181747437,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.1266278177499771,
"rewards/margins": 1.351570963859558,
"rewards/rejected": -1.478198766708374,
"step": 171,
"train_speed(iter/s)": 0.021277
},
{
"epoch": 0.3473870234789195,
"grad_norm": 6.634700775146484,
"learning_rate": 0.00019180198838114282,
"logits/chosen": -0.9056757688522339,
"logits/rejected": -0.9392012357711792,
"logps/chosen": -1.7248777151107788,
"logps/rejected": -23.6937255859375,
"loss": 0.8178808093070984,
"memory(GiB)": 45.64,
"nll_loss": 0.37585797905921936,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18669246137142181,
"rewards/margins": 1.2759226560592651,
"rewards/rejected": -1.0892301797866821,
"step": 172,
"train_speed(iter/s)": 0.021279
},
{
"epoch": 0.3494067154758899,
"grad_norm": 6.2399725914001465,
"learning_rate": 0.00019166894939208237,
"logits/chosen": -0.8763759732246399,
"logits/rejected": -0.8875811100006104,
"logps/chosen": -4.987262725830078,
"logps/rejected": -23.384920120239258,
"loss": 0.953944742679596,
"memory(GiB)": 45.64,
"nll_loss": 0.5001811385154724,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.11620373278856277,
"rewards/margins": 1.522448182106018,
"rewards/rejected": -1.6386518478393555,
"step": 173,
"train_speed(iter/s)": 0.02128
},
{
"epoch": 0.3514264074728604,
"grad_norm": 2.378427743911743,
"learning_rate": 0.0001915348864833476,
"logits/chosen": -0.8616642951965332,
"logits/rejected": -0.9031955003738403,
"logps/chosen": -2.75161075592041,
"logps/rejected": -17.232093811035156,
"loss": 0.7261631488800049,
"memory(GiB)": 45.64,
"nll_loss": 0.3087785542011261,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24855753779411316,
"rewards/margins": 0.8990098237991333,
"rewards/rejected": -0.650452196598053,
"step": 174,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.35344609946983085,
"grad_norm": 2.4263904094696045,
"learning_rate": 0.00019139980115238827,
"logits/chosen": -0.8389776945114136,
"logits/rejected": -0.8697970509529114,
"logps/chosen": -4.028109073638916,
"logps/rejected": -18.706117630004883,
"loss": 0.780457615852356,
"memory(GiB)": 45.64,
"nll_loss": 0.2751180827617645,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.006659353151917458,
"rewards/margins": 0.7851797342300415,
"rewards/rejected": -0.791839063167572,
"step": 175,
"train_speed(iter/s)": 0.021283
},
{
"epoch": 0.3554657914668013,
"grad_norm": 2.074300765991211,
"learning_rate": 0.00019126369490807447,
"logits/chosen": -0.8048940896987915,
"logits/rejected": -0.884000301361084,
"logps/chosen": -1.4055310487747192,
"logps/rejected": -25.309282302856445,
"loss": 0.4804037809371948,
"memory(GiB)": 45.64,
"nll_loss": 0.14255806803703308,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.40084120631217957,
"rewards/margins": 1.3346383571624756,
"rewards/rejected": -0.9337972402572632,
"step": 176,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.3574854834637718,
"grad_norm": 3.744903802871704,
"learning_rate": 0.00019112656927067955,
"logits/chosen": -0.8155094981193542,
"logits/rejected": -0.8395469784736633,
"logps/chosen": -11.99010944366455,
"logps/rejected": -26.437166213989258,
"loss": 0.8095741271972656,
"memory(GiB)": 45.64,
"nll_loss": 0.34381529688835144,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.11786942183971405,
"rewards/margins": 1.111412763595581,
"rewards/rejected": -1.2292821407318115,
"step": 177,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.35950517546074223,
"grad_norm": 2.4447503089904785,
"learning_rate": 0.00019098842577186314,
"logits/chosen": -0.8492040634155273,
"logits/rejected": -0.9052773714065552,
"logps/chosen": -2.7093420028686523,
"logps/rejected": -21.28760528564453,
"loss": 0.6568049192428589,
"memory(GiB)": 45.64,
"nll_loss": 0.21920911967754364,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19283369183540344,
"rewards/margins": 1.1686737537384033,
"rewards/rejected": -0.9758400321006775,
"step": 178,
"train_speed(iter/s)": 0.021285
},
{
"epoch": 0.3615248674577127,
"grad_norm": 2.275618314743042,
"learning_rate": 0.0001908492659546543,
"logits/chosen": -0.7995213866233826,
"logits/rejected": -0.9124236106872559,
"logps/chosen": -2.1147406101226807,
"logps/rejected": -30.72578239440918,
"loss": 0.5593333840370178,
"memory(GiB)": 45.64,
"nll_loss": 0.1950627565383911,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16707345843315125,
"rewards/margins": 1.2975778579711914,
"rewards/rejected": -1.1305043697357178,
"step": 179,
"train_speed(iter/s)": 0.021285
},
{
"epoch": 0.36354455945468317,
"grad_norm": 3.495725631713867,
"learning_rate": 0.00019070909137343408,
"logits/chosen": -0.9321005940437317,
"logits/rejected": -0.9968794584274292,
"logps/chosen": -3.873347759246826,
"logps/rejected": -28.580020904541016,
"loss": 0.6998752951622009,
"memory(GiB)": 45.64,
"nll_loss": 0.46146360039711,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.157605841755867,
"rewards/margins": 1.7749366760253906,
"rewards/rejected": -1.6173310279846191,
"step": 180,
"train_speed(iter/s)": 0.021286
},
{
"epoch": 0.3655642514516536,
"grad_norm": 2.6631152629852295,
"learning_rate": 0.0001905679035939181,
"logits/chosen": -0.9386301636695862,
"logits/rejected": -1.0215297937393188,
"logps/chosen": -0.5281402468681335,
"logps/rejected": -32.908546447753906,
"loss": 0.3208782374858856,
"memory(GiB)": 45.64,
"nll_loss": 0.11616937071084976,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.27659526467323303,
"rewards/margins": 2.29314923286438,
"rewards/rejected": -2.016554117202759,
"step": 181,
"train_speed(iter/s)": 0.021288
},
{
"epoch": 0.3675839434486241,
"grad_norm": 10.830909729003906,
"learning_rate": 0.00019042570419313925,
"logits/chosen": -0.970279335975647,
"logits/rejected": -1.0291110277175903,
"logps/chosen": -8.81902027130127,
"logps/rejected": -42.53478240966797,
"loss": 1.1662126779556274,
"memory(GiB)": 45.64,
"nll_loss": 0.6375398635864258,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.26809704303741455,
"rewards/margins": 2.575526237487793,
"rewards/rejected": -2.843623161315918,
"step": 182,
"train_speed(iter/s)": 0.021289
},
{
"epoch": 0.36960363544559455,
"grad_norm": 9.357040405273438,
"learning_rate": 0.0001902824947594299,
"logits/chosen": -0.9984275102615356,
"logits/rejected": -1.0901621580123901,
"logps/chosen": -4.183664321899414,
"logps/rejected": -42.764862060546875,
"loss": 0.8461188077926636,
"memory(GiB)": 45.64,
"nll_loss": 0.662725031375885,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08130670338869095,
"rewards/margins": 3.4639174938201904,
"rewards/rejected": -3.3826112747192383,
"step": 183,
"train_speed(iter/s)": 0.02129
},
{
"epoch": 0.371623327442565,
"grad_norm": 22.538454055786133,
"learning_rate": 0.00019013827689240436,
"logits/chosen": -0.9899927973747253,
"logits/rejected": -1.0915980339050293,
"logps/chosen": -5.971269130706787,
"logps/rejected": -41.92043685913086,
"loss": 1.3363139629364014,
"memory(GiB)": 45.64,
"nll_loss": 0.7483702301979065,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.24273402988910675,
"rewards/margins": 2.6009511947631836,
"rewards/rejected": -2.8436849117279053,
"step": 184,
"train_speed(iter/s)": 0.021291
},
{
"epoch": 0.3736430194395355,
"grad_norm": 5.44999361038208,
"learning_rate": 0.0001899930522029408,
"logits/chosen": -0.9289810061454773,
"logits/rejected": -1.0461653470993042,
"logps/chosen": -13.561850547790527,
"logps/rejected": -50.344093322753906,
"loss": 1.021875262260437,
"memory(GiB)": 45.64,
"nll_loss": 0.7987765669822693,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.4458293318748474,
"rewards/margins": 2.7672858238220215,
"rewards/rejected": -3.2131152153015137,
"step": 185,
"train_speed(iter/s)": 0.021291
},
{
"epoch": 0.3756627114365059,
"grad_norm": 9.218350410461426,
"learning_rate": 0.00018984682231316333,
"logits/chosen": -0.9281139373779297,
"logits/rejected": -1.0329409837722778,
"logps/chosen": -3.859086036682129,
"logps/rejected": -30.334747314453125,
"loss": 1.411182165145874,
"memory(GiB)": 45.64,
"nll_loss": 0.8451413512229919,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.08102743327617645,
"rewards/margins": 1.733138084411621,
"rewards/rejected": -1.6521105766296387,
"step": 186,
"train_speed(iter/s)": 0.021292
},
{
"epoch": 0.3776824034334764,
"grad_norm": 9.405385971069336,
"learning_rate": 0.00018969958885642398,
"logits/chosen": -0.9063903093338013,
"logits/rejected": -1.0287251472473145,
"logps/chosen": -5.265182971954346,
"logps/rejected": -53.523624420166016,
"loss": 0.5908830165863037,
"memory(GiB)": 45.64,
"nll_loss": 0.38780495524406433,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0466960184276104,
"rewards/margins": 3.7127225399017334,
"rewards/rejected": -3.6660263538360596,
"step": 187,
"train_speed(iter/s)": 0.021292
},
{
"epoch": 0.37970209543044686,
"grad_norm": 2.527911901473999,
"learning_rate": 0.00018955135347728432,
"logits/chosen": -0.749373733997345,
"logits/rejected": -0.9382051229476929,
"logps/chosen": -1.4075103998184204,
"logps/rejected": -48.75277328491211,
"loss": 0.32720643281936646,
"memory(GiB)": 45.64,
"nll_loss": 0.15030686557292938,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2724253535270691,
"rewards/margins": 2.877960205078125,
"rewards/rejected": -2.605534791946411,
"step": 188,
"train_speed(iter/s)": 0.021292
},
{
"epoch": 0.3817217874274173,
"grad_norm": 3.514798164367676,
"learning_rate": 0.00018940211783149722,
"logits/chosen": -0.9332194924354553,
"logits/rejected": -0.9634183049201965,
"logps/chosen": -3.9122090339660645,
"logps/rejected": -23.81725311279297,
"loss": 0.5536522269248962,
"memory(GiB)": 45.64,
"nll_loss": 0.2619181275367737,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2673307955265045,
"rewards/margins": 1.8769687414169312,
"rewards/rejected": -1.609637975692749,
"step": 189,
"train_speed(iter/s)": 0.021293
},
{
"epoch": 0.3837414794243878,
"grad_norm": 3.0047051906585693,
"learning_rate": 0.00018925188358598813,
"logits/chosen": -0.874540388584137,
"logits/rejected": -0.9682676792144775,
"logps/chosen": -1.5275218486785889,
"logps/rejected": -36.20308303833008,
"loss": 0.476752907037735,
"memory(GiB)": 45.64,
"nll_loss": 0.12829114496707916,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1873767375946045,
"rewards/margins": 2.56374454498291,
"rewards/rejected": -2.3763678073883057,
"step": 190,
"train_speed(iter/s)": 0.021294
},
{
"epoch": 0.38576117142135824,
"grad_norm": 5.604814052581787,
"learning_rate": 0.0001891006524188368,
"logits/chosen": -0.8748272657394409,
"logits/rejected": -0.8527596592903137,
"logps/chosen": -22.366464614868164,
"logps/rejected": -31.544967651367188,
"loss": 0.844088077545166,
"memory(GiB)": 45.64,
"nll_loss": 0.34909212589263916,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.017623694613575935,
"rewards/margins": 1.6229170560836792,
"rewards/rejected": -1.6052933931350708,
"step": 191,
"train_speed(iter/s)": 0.021293
},
{
"epoch": 0.3877808634183287,
"grad_norm": 3.902900457382202,
"learning_rate": 0.0001889484260192582,
"logits/chosen": -0.8291831612586975,
"logits/rejected": -0.9175705909729004,
"logps/chosen": -3.4213364124298096,
"logps/rejected": -28.334596633911133,
"loss": 0.6280531883239746,
"memory(GiB)": 45.64,
"nll_loss": 0.2871948778629303,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.20435035228729248,
"rewards/margins": 1.6512333154678345,
"rewards/rejected": -1.446882963180542,
"step": 192,
"train_speed(iter/s)": 0.021293
},
{
"epoch": 0.3898005554152992,
"grad_norm": 3.3589909076690674,
"learning_rate": 0.00018879520608758394,
"logits/chosen": -0.7861786484718323,
"logits/rejected": -0.9745673537254333,
"logps/chosen": -2.2813668251037598,
"logps/rejected": -30.406993865966797,
"loss": 0.46809083223342896,
"memory(GiB)": 45.64,
"nll_loss": 0.24172116816043854,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2660973072052002,
"rewards/margins": 1.8777257204055786,
"rewards/rejected": -1.6116284132003784,
"step": 193,
"train_speed(iter/s)": 0.021294
},
{
"epoch": 0.3918202474122696,
"grad_norm": 3.7471225261688232,
"learning_rate": 0.000188640994335243,
"logits/chosen": -0.8293952941894531,
"logits/rejected": -0.9208282232284546,
"logps/chosen": -2.756782293319702,
"logps/rejected": -28.273818969726562,
"loss": 0.7544887065887451,
"memory(GiB)": 45.64,
"nll_loss": 0.3577630817890167,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12236475944519043,
"rewards/margins": 1.8170613050460815,
"rewards/rejected": -1.6946964263916016,
"step": 194,
"train_speed(iter/s)": 0.021295
},
{
"epoch": 0.3938399394092401,
"grad_norm": 3.194539785385132,
"learning_rate": 0.00018848579248474288,
"logits/chosen": -0.7125469446182251,
"logits/rejected": -0.888473391532898,
"logps/chosen": -4.232546329498291,
"logps/rejected": -34.417152404785156,
"loss": 0.634448230266571,
"memory(GiB)": 45.64,
"nll_loss": 0.23650826513767242,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3275882303714752,
"rewards/margins": 1.5964200496673584,
"rewards/rejected": -1.2688318490982056,
"step": 195,
"train_speed(iter/s)": 0.021294
},
{
"epoch": 0.39585963140621055,
"grad_norm": 7.319854736328125,
"learning_rate": 0.00018832960226965008,
"logits/chosen": -0.8826249837875366,
"logits/rejected": -0.9558060169219971,
"logps/chosen": -2.2309622764587402,
"logps/rejected": -23.310834884643555,
"loss": 0.7857663035392761,
"memory(GiB)": 45.64,
"nll_loss": 0.31681591272354126,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.3184216618537903,
"rewards/margins": 1.3100265264511108,
"rewards/rejected": -0.9916048049926758,
"step": 196,
"train_speed(iter/s)": 0.021296
},
{
"epoch": 0.397879323403181,
"grad_norm": 4.467423439025879,
"learning_rate": 0.00018817242543457108,
"logits/chosen": -0.7410279512405396,
"logits/rejected": -0.8783193826675415,
"logps/chosen": -6.2165632247924805,
"logps/rejected": -40.68191909790039,
"loss": 0.8568143844604492,
"memory(GiB)": 45.64,
"nll_loss": 0.4732620418071747,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06536143273115158,
"rewards/margins": 1.7412124872207642,
"rewards/rejected": -1.6758511066436768,
"step": 197,
"train_speed(iter/s)": 0.021296
},
{
"epoch": 0.3998990154001515,
"grad_norm": 3.227818250656128,
"learning_rate": 0.0001880142637351325,
"logits/chosen": -0.8976326584815979,
"logits/rejected": -0.9664545059204102,
"logps/chosen": -2.204209804534912,
"logps/rejected": -19.951866149902344,
"loss": 0.5582164525985718,
"memory(GiB)": 45.64,
"nll_loss": 0.18982845544815063,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3193460702896118,
"rewards/margins": 1.213867425918579,
"rewards/rejected": -0.8945214748382568,
"step": 198,
"train_speed(iter/s)": 0.021297
},
{
"epoch": 0.40191870739712193,
"grad_norm": 5.091889381408691,
"learning_rate": 0.00018785511893796176,
"logits/chosen": -0.813483476638794,
"logits/rejected": -0.9725134968757629,
"logps/chosen": -1.0746464729309082,
"logps/rejected": -31.801054000854492,
"loss": 0.38803631067276,
"memory(GiB)": 45.64,
"nll_loss": 0.18849264085292816,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.29135608673095703,
"rewards/margins": 1.9811937808990479,
"rewards/rejected": -1.6898375749588013,
"step": 199,
"train_speed(iter/s)": 0.021298
},
{
"epoch": 0.4039383993940924,
"grad_norm": 3.733981132507324,
"learning_rate": 0.00018769499282066717,
"logits/chosen": -0.8599748015403748,
"logits/rejected": -0.9630089998245239,
"logps/chosen": -2.635427236557007,
"logps/rejected": -24.271150588989258,
"loss": 0.6127274036407471,
"memory(GiB)": 45.64,
"nll_loss": 0.2767713665962219,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2570668160915375,
"rewards/margins": 1.4302881956100464,
"rewards/rejected": -1.1732213497161865,
"step": 200,
"train_speed(iter/s)": 0.021299
},
{
"epoch": 0.40595809139106287,
"grad_norm": 4.356893062591553,
"learning_rate": 0.0001875338871718182,
"logits/chosen": -0.8239525556564331,
"logits/rejected": -0.9406594634056091,
"logps/chosen": -3.5920815467834473,
"logps/rejected": -33.701141357421875,
"loss": 0.7486278414726257,
"memory(GiB)": 45.64,
"nll_loss": 0.34808939695358276,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06076638400554657,
"rewards/margins": 1.9439024925231934,
"rewards/rejected": -1.8831360340118408,
"step": 201,
"train_speed(iter/s)": 0.021262
},
{
"epoch": 0.4079777833880333,
"grad_norm": 3.3695449829101562,
"learning_rate": 0.00018737180379092537,
"logits/chosen": -0.7839801907539368,
"logits/rejected": -0.8861851096153259,
"logps/chosen": -8.617507934570312,
"logps/rejected": -47.99607849121094,
"loss": 0.5823696851730347,
"memory(GiB)": 45.64,
"nll_loss": 0.3239917457103729,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.02249305695295334,
"rewards/margins": 3.1341774463653564,
"rewards/rejected": -3.1116843223571777,
"step": 202,
"train_speed(iter/s)": 0.021262
},
{
"epoch": 0.4099974753850038,
"grad_norm": 2.5396463871002197,
"learning_rate": 0.00018720874448842034,
"logits/chosen": -0.8206271529197693,
"logits/rejected": -1.0252444744110107,
"logps/chosen": -1.0570971965789795,
"logps/rejected": -47.1510124206543,
"loss": 0.324438214302063,
"memory(GiB)": 45.64,
"nll_loss": 0.11744873970746994,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.36073753237724304,
"rewards/margins": 3.558206558227539,
"rewards/rejected": -3.1974687576293945,
"step": 203,
"train_speed(iter/s)": 0.021263
},
{
"epoch": 0.41201716738197425,
"grad_norm": 3.693103551864624,
"learning_rate": 0.00018704471108563548,
"logits/chosen": -0.8473316431045532,
"logits/rejected": -0.9990904927253723,
"logps/chosen": -4.564356803894043,
"logps/rejected": -40.657447814941406,
"loss": 0.4926657974720001,
"memory(GiB)": 45.64,
"nll_loss": 0.2881479859352112,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39431607723236084,
"rewards/margins": 2.6521053314208984,
"rewards/rejected": -2.257789373397827,
"step": 204,
"train_speed(iter/s)": 0.021263
},
{
"epoch": 0.4140368593789447,
"grad_norm": 5.1197896003723145,
"learning_rate": 0.00018687970541478364,
"logits/chosen": -0.8696497082710266,
"logits/rejected": -1.0545570850372314,
"logps/chosen": -1.4695444107055664,
"logps/rejected": -46.127044677734375,
"loss": 0.34414029121398926,
"memory(GiB)": 45.64,
"nll_loss": 0.16013705730438232,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.33041495084762573,
"rewards/margins": 3.691737174987793,
"rewards/rejected": -3.3613224029541016,
"step": 205,
"train_speed(iter/s)": 0.021264
},
{
"epoch": 0.4160565513759152,
"grad_norm": 11.712461471557617,
"learning_rate": 0.00018671372931893773,
"logits/chosen": -0.9976873993873596,
"logits/rejected": -1.0082725286483765,
"logps/chosen": -6.205466270446777,
"logps/rejected": -21.121868133544922,
"loss": 1.509117841720581,
"memory(GiB)": 45.64,
"nll_loss": 0.9143091440200806,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.13785380125045776,
"rewards/margins": 1.1608891487121582,
"rewards/rejected": -1.2987430095672607,
"step": 206,
"train_speed(iter/s)": 0.021265
},
{
"epoch": 0.4180762433728856,
"grad_norm": 4.418537616729736,
"learning_rate": 0.00018654678465201,
"logits/chosen": -0.9154266119003296,
"logits/rejected": -0.981490969657898,
"logps/chosen": -9.175884246826172,
"logps/rejected": -32.25775146484375,
"loss": 0.7383416891098022,
"memory(GiB)": 45.64,
"nll_loss": 0.3417145013809204,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.03129662945866585,
"rewards/margins": 2.172858476638794,
"rewards/rejected": -2.14156174659729,
"step": 207,
"train_speed(iter/s)": 0.021266
},
{
"epoch": 0.4200959353698561,
"grad_norm": 4.682573318481445,
"learning_rate": 0.0001863788732787314,
"logits/chosen": -0.845721423625946,
"logits/rejected": -1.0325840711593628,
"logps/chosen": -3.112144708633423,
"logps/rejected": -48.1558952331543,
"loss": 0.4932224452495575,
"memory(GiB)": 45.64,
"nll_loss": 0.3019799590110779,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16389404237270355,
"rewards/margins": 3.949674367904663,
"rewards/rejected": -3.785780429840088,
"step": 208,
"train_speed(iter/s)": 0.021267
},
{
"epoch": 0.42211562736682656,
"grad_norm": 6.930049419403076,
"learning_rate": 0.0001862099970746308,
"logits/chosen": -0.8911486268043518,
"logits/rejected": -1.048769474029541,
"logps/chosen": -3.7173314094543457,
"logps/rejected": -37.73887252807617,
"loss": 0.6971174478530884,
"memory(GiB)": 45.64,
"nll_loss": 0.3776175379753113,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14115534722805023,
"rewards/margins": 2.630204200744629,
"rewards/rejected": -2.489048719406128,
"step": 209,
"train_speed(iter/s)": 0.021268
},
{
"epoch": 0.424135319363797,
"grad_norm": 3.0014336109161377,
"learning_rate": 0.00018604015792601396,
"logits/chosen": -0.7730808854103088,
"logits/rejected": -0.9816968441009521,
"logps/chosen": -0.3805132210254669,
"logps/rejected": -53.63943099975586,
"loss": 0.21242156624794006,
"memory(GiB)": 45.64,
"nll_loss": 0.05388123169541359,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3490655720233917,
"rewards/margins": 3.7549197673797607,
"rewards/rejected": -3.4058542251586914,
"step": 210,
"train_speed(iter/s)": 0.021268
},
{
"epoch": 0.4261550113607675,
"grad_norm": 6.788722991943359,
"learning_rate": 0.00018586935772994245,
"logits/chosen": -0.7963772416114807,
"logits/rejected": -1.0568972826004028,
"logps/chosen": -1.2283453941345215,
"logps/rejected": -59.22148132324219,
"loss": 0.18988274037837982,
"memory(GiB)": 45.64,
"nll_loss": 0.12394578754901886,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4420156478881836,
"rewards/margins": 4.728057384490967,
"rewards/rejected": -4.286042213439941,
"step": 211,
"train_speed(iter/s)": 0.021269
},
{
"epoch": 0.42817470335773794,
"grad_norm": 2.8118438720703125,
"learning_rate": 0.00018569759839421265,
"logits/chosen": -0.819808840751648,
"logits/rejected": -0.9025678038597107,
"logps/chosen": -2.9665253162384033,
"logps/rejected": -40.64404296875,
"loss": 0.33937186002731323,
"memory(GiB)": 45.64,
"nll_loss": 0.11274304240942001,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4729611575603485,
"rewards/margins": 3.319221019744873,
"rewards/rejected": -2.8462600708007812,
"step": 212,
"train_speed(iter/s)": 0.021269
},
{
"epoch": 0.4301943953547084,
"grad_norm": 4.191134452819824,
"learning_rate": 0.00018552488183733412,
"logits/chosen": -0.8641024231910706,
"logits/rejected": -0.9831883907318115,
"logps/chosen": -7.590506553649902,
"logps/rejected": -40.67595672607422,
"loss": 0.6653822064399719,
"memory(GiB)": 45.64,
"nll_loss": 0.3946245610713959,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.004725143313407898,
"rewards/margins": 2.8683340549468994,
"rewards/rejected": -2.8730592727661133,
"step": 213,
"train_speed(iter/s)": 0.021269
},
{
"epoch": 0.4322140873516789,
"grad_norm": 7.408899307250977,
"learning_rate": 0.00018535120998850848,
"logits/chosen": -0.9360211491584778,
"logits/rejected": -1.0136916637420654,
"logps/chosen": -5.061653137207031,
"logps/rejected": -31.533058166503906,
"loss": 0.8134801983833313,
"memory(GiB)": 45.64,
"nll_loss": 0.38820868730545044,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2650642693042755,
"rewards/margins": 2.2353947162628174,
"rewards/rejected": -1.9703304767608643,
"step": 214,
"train_speed(iter/s)": 0.021271
},
{
"epoch": 0.4342337793486493,
"grad_norm": 6.260317802429199,
"learning_rate": 0.0001851765847876076,
"logits/chosen": -0.9736087322235107,
"logits/rejected": -1.0754610300064087,
"logps/chosen": -6.311574935913086,
"logps/rejected": -41.57005310058594,
"loss": 1.0864337682724,
"memory(GiB)": 45.64,
"nll_loss": 0.6948180794715881,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.11255162954330444,
"rewards/margins": 2.995018482208252,
"rewards/rejected": -3.107570171356201,
"step": 215,
"train_speed(iter/s)": 0.021272
},
{
"epoch": 0.4362534713456198,
"grad_norm": 13.104352951049805,
"learning_rate": 0.00018500100818515222,
"logits/chosen": -0.6429583430290222,
"logits/rejected": -0.9696972966194153,
"logps/chosen": -2.051022529602051,
"logps/rejected": -83.3814697265625,
"loss": 0.6120116710662842,
"memory(GiB)": 45.64,
"nll_loss": 0.312576562166214,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.121861532330513,
"rewards/margins": 5.671273708343506,
"rewards/rejected": -5.549411773681641,
"step": 216,
"train_speed(iter/s)": 0.021271
},
{
"epoch": 0.43827316334259026,
"grad_norm": 7.3358564376831055,
"learning_rate": 0.0001848244821422899,
"logits/chosen": -1.0172042846679688,
"logits/rejected": -1.0574982166290283,
"logps/chosen": -3.74454927444458,
"logps/rejected": -25.982912063598633,
"loss": 0.8323017358779907,
"memory(GiB)": 45.64,
"nll_loss": 0.30521970987319946,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1191268116235733,
"rewards/margins": 1.8004627227783203,
"rewards/rejected": -1.6813361644744873,
"step": 217,
"train_speed(iter/s)": 0.021273
},
{
"epoch": 0.4402928553395607,
"grad_norm": 2.6182119846343994,
"learning_rate": 0.00018464700863077312,
"logits/chosen": -0.995885968208313,
"logits/rejected": -1.102242350578308,
"logps/chosen": -1.5725170373916626,
"logps/rejected": -46.24748229980469,
"loss": 0.3959670662879944,
"memory(GiB)": 45.64,
"nll_loss": 0.1685146987438202,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.18964146077632904,
"rewards/margins": 3.7616095542907715,
"rewards/rejected": -3.5719680786132812,
"step": 218,
"train_speed(iter/s)": 0.021274
},
{
"epoch": 0.4423125473365312,
"grad_norm": 5.691047191619873,
"learning_rate": 0.00018446858963293763,
"logits/chosen": -0.9241669178009033,
"logits/rejected": -1.0488460063934326,
"logps/chosen": -2.7383437156677246,
"logps/rejected": -53.106632232666016,
"loss": 0.46598395705223083,
"memory(GiB)": 45.64,
"nll_loss": 0.28670936822891235,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08014581352472305,
"rewards/margins": 3.8416402339935303,
"rewards/rejected": -3.7614941596984863,
"step": 219,
"train_speed(iter/s)": 0.021275
},
{
"epoch": 0.44433223933350163,
"grad_norm": 6.792243957519531,
"learning_rate": 0.0001842892271416797,
"logits/chosen": -0.867421567440033,
"logits/rejected": -1.0047706365585327,
"logps/chosen": -3.9948360919952393,
"logps/rejected": -40.925697326660156,
"loss": 0.559948205947876,
"memory(GiB)": 45.64,
"nll_loss": 0.2816776633262634,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.27128446102142334,
"rewards/margins": 2.5824544429779053,
"rewards/rejected": -2.3111701011657715,
"step": 220,
"train_speed(iter/s)": 0.021275
},
{
"epoch": 0.44635193133047213,
"grad_norm": 2.8233304023742676,
"learning_rate": 0.00018410892316043448,
"logits/chosen": -0.7455387711524963,
"logits/rejected": -1.0043134689331055,
"logps/chosen": -2.28206205368042,
"logps/rejected": -50.90422821044922,
"loss": 0.4489433765411377,
"memory(GiB)": 45.64,
"nll_loss": 0.17719773948192596,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.17336970567703247,
"rewards/margins": 3.006608009338379,
"rewards/rejected": -2.833238363265991,
"step": 221,
"train_speed(iter/s)": 0.021276
},
{
"epoch": 0.44837162332744257,
"grad_norm": 3.7978217601776123,
"learning_rate": 0.00018392767970315313,
"logits/chosen": -0.9136677980422974,
"logits/rejected": -1.06996488571167,
"logps/chosen": -1.5614748001098633,
"logps/rejected": -34.510162353515625,
"loss": 0.3262411057949066,
"memory(GiB)": 45.64,
"nll_loss": 0.1898116022348404,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3149145543575287,
"rewards/margins": 2.7444238662719727,
"rewards/rejected": -2.429509162902832,
"step": 222,
"train_speed(iter/s)": 0.021277
},
{
"epoch": 0.450391315324413,
"grad_norm": 6.886748313903809,
"learning_rate": 0.00018374549879428062,
"logits/chosen": -0.9338952302932739,
"logits/rejected": -1.0804352760314941,
"logps/chosen": -1.0283788442611694,
"logps/rejected": -38.30894088745117,
"loss": 0.3192234933376312,
"memory(GiB)": 45.64,
"nll_loss": 0.11882957816123962,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24301038682460785,
"rewards/margins": 2.798785924911499,
"rewards/rejected": -2.5557756423950195,
"step": 223,
"train_speed(iter/s)": 0.021278
},
{
"epoch": 0.4524110073213835,
"grad_norm": 6.402444362640381,
"learning_rate": 0.000183562382468733,
"logits/chosen": -0.9219646453857422,
"logits/rejected": -1.0332969427108765,
"logps/chosen": -4.296561241149902,
"logps/rejected": -32.83451843261719,
"loss": 1.1228792667388916,
"memory(GiB)": 45.64,
"nll_loss": 0.8876572251319885,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.020390525460243225,
"rewards/margins": 2.142768383026123,
"rewards/rejected": -2.163159132003784,
"step": 224,
"train_speed(iter/s)": 0.021279
},
{
"epoch": 0.45443069931835395,
"grad_norm": 9.758877754211426,
"learning_rate": 0.00018337833277187472,
"logits/chosen": -0.8922550082206726,
"logits/rejected": -0.9859142303466797,
"logps/chosen": -7.753718376159668,
"logps/rejected": -28.561172485351562,
"loss": 1.4200571775436401,
"memory(GiB)": 45.64,
"nll_loss": 0.8696328997612,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.07261030375957489,
"rewards/margins": 1.1861965656280518,
"rewards/rejected": -1.2588069438934326,
"step": 225,
"train_speed(iter/s)": 0.02128
},
{
"epoch": 0.4564503913153244,
"grad_norm": 7.866222858428955,
"learning_rate": 0.0001831933517594957,
"logits/chosen": -0.7848281860351562,
"logits/rejected": -1.0049529075622559,
"logps/chosen": -2.8492534160614014,
"logps/rejected": -53.778289794921875,
"loss": 0.520083487033844,
"memory(GiB)": 45.64,
"nll_loss": 0.3156394362449646,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19083034992218018,
"rewards/margins": 3.20526123046875,
"rewards/rejected": -3.0144309997558594,
"step": 226,
"train_speed(iter/s)": 0.02128
},
{
"epoch": 0.4584700833122949,
"grad_norm": 4.694428443908691,
"learning_rate": 0.00018300744149778853,
"logits/chosen": -0.9140058755874634,
"logits/rejected": -1.035470724105835,
"logps/chosen": -0.7746766805648804,
"logps/rejected": -31.849538803100586,
"loss": 0.41979673504829407,
"memory(GiB)": 45.64,
"nll_loss": 0.1669030785560608,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.34211465716362,
"rewards/margins": 2.157820701599121,
"rewards/rejected": -1.8157060146331787,
"step": 227,
"train_speed(iter/s)": 0.021281
},
{
"epoch": 0.4604897753092653,
"grad_norm": 4.092323303222656,
"learning_rate": 0.00018282060406332512,
"logits/chosen": -0.8949604034423828,
"logits/rejected": -1.0626131296157837,
"logps/chosen": -2.425996780395508,
"logps/rejected": -28.149372100830078,
"loss": 0.4806259274482727,
"memory(GiB)": 45.64,
"nll_loss": 0.22964058816432953,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2916340231895447,
"rewards/margins": 1.6805919408798218,
"rewards/rejected": -1.3889580965042114,
"step": 228,
"train_speed(iter/s)": 0.021281
},
{
"epoch": 0.4625094673062358,
"grad_norm": 4.152270317077637,
"learning_rate": 0.0001826328415430339,
"logits/chosen": -1.0330709218978882,
"logits/rejected": -1.1299700736999512,
"logps/chosen": -2.0911142826080322,
"logps/rejected": -25.8432674407959,
"loss": 0.47937411069869995,
"memory(GiB)": 45.64,
"nll_loss": 0.24223287403583527,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22816987335681915,
"rewards/margins": 1.9592314958572388,
"rewards/rejected": -1.7310616970062256,
"step": 229,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.46452915930320626,
"grad_norm": 3.1440939903259277,
"learning_rate": 0.00018244415603417603,
"logits/chosen": -0.9888077974319458,
"logits/rejected": -1.087904930114746,
"logps/chosen": -1.7838736772537231,
"logps/rejected": -31.170108795166016,
"loss": 0.5677547454833984,
"memory(GiB)": 45.64,
"nll_loss": 0.2625994384288788,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.36328813433647156,
"rewards/margins": 2.194064140319824,
"rewards/rejected": -1.8307762145996094,
"step": 230,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.4665488513001767,
"grad_norm": 3.9995431900024414,
"learning_rate": 0.00018225454964432248,
"logits/chosen": -0.8009510040283203,
"logits/rejected": -0.9875888824462891,
"logps/chosen": -4.417139530181885,
"logps/rejected": -39.54981231689453,
"loss": 0.5815356969833374,
"memory(GiB)": 45.64,
"nll_loss": 0.4281938374042511,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.21771493554115295,
"rewards/margins": 2.3999886512756348,
"rewards/rejected": -2.1822738647460938,
"step": 231,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.4685685432971472,
"grad_norm": 5.97980260848999,
"learning_rate": 0.00018206402449132995,
"logits/chosen": -0.8073972463607788,
"logits/rejected": -1.005049705505371,
"logps/chosen": -3.3927805423736572,
"logps/rejected": -40.57596206665039,
"loss": 0.6254691481590271,
"memory(GiB)": 45.64,
"nll_loss": 0.36383697390556335,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1796584278345108,
"rewards/margins": 1.9802054166793823,
"rewards/rejected": -1.8005468845367432,
"step": 232,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.47058823529411764,
"grad_norm": 3.2046210765838623,
"learning_rate": 0.00018187258270331783,
"logits/chosen": -0.843147873878479,
"logits/rejected": -0.9698415398597717,
"logps/chosen": -6.980717182159424,
"logps/rejected": -47.44036865234375,
"loss": 0.42867493629455566,
"memory(GiB)": 45.64,
"nll_loss": 0.22475841641426086,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.42296847701072693,
"rewards/margins": 3.3137428760528564,
"rewards/rejected": -2.8907744884490967,
"step": 233,
"train_speed(iter/s)": 0.021283
},
{
"epoch": 0.47260792729108814,
"grad_norm": 5.650546550750732,
"learning_rate": 0.00018168022641864377,
"logits/chosen": -0.9458031058311462,
"logits/rejected": -1.022731900215149,
"logps/chosen": -5.699041366577148,
"logps/rejected": -27.91295051574707,
"loss": 0.6052364706993103,
"memory(GiB)": 45.64,
"nll_loss": 0.25157076120376587,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.17266854643821716,
"rewards/margins": 2.01995587348938,
"rewards/rejected": -1.8472874164581299,
"step": 234,
"train_speed(iter/s)": 0.021283
},
{
"epoch": 0.4746276192880586,
"grad_norm": 7.562004089355469,
"learning_rate": 0.00018148695778588033,
"logits/chosen": -0.8491840362548828,
"logits/rejected": -0.9722462296485901,
"logps/chosen": -8.168458938598633,
"logps/rejected": -39.646427154541016,
"loss": 1.076995849609375,
"memory(GiB)": 45.64,
"nll_loss": 0.6254736185073853,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23536130785942078,
"rewards/margins": 2.3698079586029053,
"rewards/rejected": -2.134446859359741,
"step": 235,
"train_speed(iter/s)": 0.021283
},
{
"epoch": 0.476647311285029,
"grad_norm": 2.8358967304229736,
"learning_rate": 0.00018129277896379077,
"logits/chosen": -0.8474506139755249,
"logits/rejected": -0.9761014580726624,
"logps/chosen": -1.0130198001861572,
"logps/rejected": -34.24652099609375,
"loss": 0.3748179078102112,
"memory(GiB)": 45.64,
"nll_loss": 0.11387713998556137,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.42450040578842163,
"rewards/margins": 2.2273645401000977,
"rewards/rejected": -1.8028637170791626,
"step": 236,
"train_speed(iter/s)": 0.021283
},
{
"epoch": 0.4786670032819995,
"grad_norm": 24.549625396728516,
"learning_rate": 0.00018109769212130487,
"logits/chosen": -0.7827628254890442,
"logits/rejected": -0.899127721786499,
"logps/chosen": -12.455778121948242,
"logps/rejected": -39.55864715576172,
"loss": 1.0212831497192383,
"memory(GiB)": 45.64,
"nll_loss": 0.6375862956047058,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.05945993959903717,
"rewards/margins": 2.1959457397460938,
"rewards/rejected": -2.2554056644439697,
"step": 237,
"train_speed(iter/s)": 0.021283
},
{
"epoch": 0.48068669527896996,
"grad_norm": 5.986259460449219,
"learning_rate": 0.00018090169943749476,
"logits/chosen": -0.9809411764144897,
"logits/rejected": -1.0568145513534546,
"logps/chosen": -2.8511006832122803,
"logps/rejected": -30.153661727905273,
"loss": 0.6427941918373108,
"memory(GiB)": 45.64,
"nll_loss": 0.31609585881233215,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.20257410407066345,
"rewards/margins": 2.3083198070526123,
"rewards/rejected": -2.105745553970337,
"step": 238,
"train_speed(iter/s)": 0.021285
},
{
"epoch": 0.4827063872759404,
"grad_norm": 6.145867824554443,
"learning_rate": 0.00018070480310155066,
"logits/chosen": -0.8342568874359131,
"logits/rejected": -0.9062321782112122,
"logps/chosen": -7.222947120666504,
"logps/rejected": -37.760414123535156,
"loss": 0.8602092862129211,
"memory(GiB)": 45.64,
"nll_loss": 0.47236353158950806,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14982852339744568,
"rewards/margins": 2.0299620628356934,
"rewards/rejected": -1.8801336288452148,
"step": 239,
"train_speed(iter/s)": 0.021285
},
{
"epoch": 0.4847260792729109,
"grad_norm": 5.842182159423828,
"learning_rate": 0.0001805070053127563,
"logits/chosen": -0.8298416137695312,
"logits/rejected": -0.9391087889671326,
"logps/chosen": -4.0047993659973145,
"logps/rejected": -34.49217224121094,
"loss": 0.6390224695205688,
"memory(GiB)": 45.64,
"nll_loss": 0.391327440738678,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.296629935503006,
"rewards/margins": 2.591277837753296,
"rewards/rejected": -2.294647693634033,
"step": 240,
"train_speed(iter/s)": 0.021285
},
{
"epoch": 0.48674577126988133,
"grad_norm": 3.0892484188079834,
"learning_rate": 0.0001803083082804645,
"logits/chosen": -0.6407896876335144,
"logits/rejected": -0.8386159539222717,
"logps/chosen": -2.6044552326202393,
"logps/rejected": -43.223602294921875,
"loss": 0.5524685978889465,
"memory(GiB)": 45.64,
"nll_loss": 0.23806366324424744,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.17818674445152283,
"rewards/margins": 2.3168139457702637,
"rewards/rejected": -2.138627052307129,
"step": 241,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.48876546326685183,
"grad_norm": 2.5642099380493164,
"learning_rate": 0.00018010871422407236,
"logits/chosen": -0.5903664231300354,
"logits/rejected": -0.817259669303894,
"logps/chosen": -1.1348421573638916,
"logps/rejected": -54.072288513183594,
"loss": 0.390775203704834,
"memory(GiB)": 45.64,
"nll_loss": 0.18238955736160278,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31289827823638916,
"rewards/margins": 3.0836544036865234,
"rewards/rejected": -2.7707560062408447,
"step": 242,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.49078515526382227,
"grad_norm": 4.531945705413818,
"learning_rate": 0.00017990822537299647,
"logits/chosen": -0.7170388698577881,
"logits/rejected": -0.8259367942810059,
"logps/chosen": -6.029257774353027,
"logps/rejected": -34.971519470214844,
"loss": 0.7846373915672302,
"memory(GiB)": 45.64,
"nll_loss": 0.31968259811401367,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.002697870135307312,
"rewards/margins": 1.6093158721923828,
"rewards/rejected": -1.612013816833496,
"step": 243,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.4928048472607927,
"grad_norm": 3.57047176361084,
"learning_rate": 0.00017970684396664813,
"logits/chosen": -0.7720434069633484,
"logits/rejected": -0.9465057253837585,
"logps/chosen": -3.873821258544922,
"logps/rejected": -37.18175506591797,
"loss": 0.8110936284065247,
"memory(GiB)": 45.64,
"nll_loss": 0.44118532538414,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19488100707530975,
"rewards/margins": 1.9362576007843018,
"rewards/rejected": -1.741376519203186,
"step": 244,
"train_speed(iter/s)": 0.021284
},
{
"epoch": 0.4948245392577632,
"grad_norm": 5.007617473602295,
"learning_rate": 0.0001795045722544083,
"logits/chosen": -0.7931674122810364,
"logits/rejected": -0.8741809129714966,
"logps/chosen": -1.8064591884613037,
"logps/rejected": -22.11163330078125,
"loss": 0.6888466477394104,
"memory(GiB)": 45.64,
"nll_loss": 0.31985488533973694,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28564998507499695,
"rewards/margins": 1.2898226976394653,
"rewards/rejected": -1.0041728019714355,
"step": 245,
"train_speed(iter/s)": 0.021285
},
{
"epoch": 0.49684423125473365,
"grad_norm": 6.91418981552124,
"learning_rate": 0.00017930141249560233,
"logits/chosen": -0.8298520445823669,
"logits/rejected": -0.9262869358062744,
"logps/chosen": -1.8928561210632324,
"logps/rejected": -22.42644691467285,
"loss": 0.5054484605789185,
"memory(GiB)": 45.64,
"nll_loss": 0.17920702695846558,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.19144940376281738,
"rewards/margins": 1.3705973625183105,
"rewards/rejected": -1.1791479587554932,
"step": 246,
"train_speed(iter/s)": 0.021286
},
{
"epoch": 0.4988639232517041,
"grad_norm": 5.468963146209717,
"learning_rate": 0.00017909736695947485,
"logits/chosen": -0.8126583695411682,
"logits/rejected": -0.9218447804450989,
"logps/chosen": -5.573441982269287,
"logps/rejected": -31.411596298217773,
"loss": 0.640342652797699,
"memory(GiB)": 45.64,
"nll_loss": 0.2689912021160126,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.249068945646286,
"rewards/margins": 1.9487626552581787,
"rewards/rejected": -1.6996936798095703,
"step": 247,
"train_speed(iter/s)": 0.021287
},
{
"epoch": 0.5008836152486745,
"grad_norm": 5.13163423538208,
"learning_rate": 0.0001788924379251645,
"logits/chosen": -0.6676142811775208,
"logits/rejected": -0.7854112982749939,
"logps/chosen": -5.0913262367248535,
"logps/rejected": -33.67715835571289,
"loss": 0.6214959621429443,
"memory(GiB)": 45.64,
"nll_loss": 0.30665862560272217,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09342917054891586,
"rewards/margins": 2.036255121231079,
"rewards/rejected": -1.9428261518478394,
"step": 248,
"train_speed(iter/s)": 0.021287
},
{
"epoch": 0.502903307245645,
"grad_norm": 5.3085246086120605,
"learning_rate": 0.00017868662768167828,
"logits/chosen": -0.8283058404922485,
"logits/rejected": -0.8981807827949524,
"logps/chosen": -3.5498528480529785,
"logps/rejected": -25.92713737487793,
"loss": 0.8023664355278015,
"memory(GiB)": 45.64,
"nll_loss": 0.3884091079235077,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.14035727083683014,
"rewards/margins": 1.476125717163086,
"rewards/rejected": -1.335768461227417,
"step": 249,
"train_speed(iter/s)": 0.021287
},
{
"epoch": 0.5049229992426155,
"grad_norm": 3.970473051071167,
"learning_rate": 0.0001784799385278661,
"logits/chosen": -0.7480765581130981,
"logits/rejected": -0.850541889667511,
"logps/chosen": -2.1585793495178223,
"logps/rejected": -25.883459091186523,
"loss": 0.5557476878166199,
"memory(GiB)": 45.64,
"nll_loss": 0.23389576375484467,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27245235443115234,
"rewards/margins": 1.5237624645233154,
"rewards/rejected": -1.2513102293014526,
"step": 250,
"train_speed(iter/s)": 0.021288
},
{
"epoch": 0.506942691239586,
"grad_norm": 2.7458653450012207,
"learning_rate": 0.00017827237277239514,
"logits/chosen": -0.7085766792297363,
"logits/rejected": -0.8612480163574219,
"logps/chosen": -1.5254360437393188,
"logps/rejected": -41.573387145996094,
"loss": 0.4261833429336548,
"memory(GiB)": 45.64,
"nll_loss": 0.20671844482421875,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.23911702632904053,
"rewards/margins": 2.4618849754333496,
"rewards/rejected": -2.2227678298950195,
"step": 251,
"train_speed(iter/s)": 0.021259
},
{
"epoch": 0.5089623832365564,
"grad_norm": 4.110019207000732,
"learning_rate": 0.00017806393273372395,
"logits/chosen": -0.6960774064064026,
"logits/rejected": -0.773073673248291,
"logps/chosen": -5.731773376464844,
"logps/rejected": -40.48484420776367,
"loss": 0.6885837912559509,
"memory(GiB)": 45.64,
"nll_loss": 0.38311967253685,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13538384437561035,
"rewards/margins": 2.754824638366699,
"rewards/rejected": -2.619440793991089,
"step": 252,
"train_speed(iter/s)": 0.021259
},
{
"epoch": 0.5109820752335269,
"grad_norm": 2.490933656692505,
"learning_rate": 0.0001778546207400766,
"logits/chosen": -0.7139323353767395,
"logits/rejected": -0.8478928208351135,
"logps/chosen": -2.643089771270752,
"logps/rejected": -49.735321044921875,
"loss": 0.4857577383518219,
"memory(GiB)": 45.64,
"nll_loss": 0.20252788066864014,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2547016441822052,
"rewards/margins": 3.3733713626861572,
"rewards/rejected": -3.1186697483062744,
"step": 253,
"train_speed(iter/s)": 0.021258
},
{
"epoch": 0.5130017672304974,
"grad_norm": 1.8276517391204834,
"learning_rate": 0.00017764443912941672,
"logits/chosen": -0.8284695148468018,
"logits/rejected": -0.9083284735679626,
"logps/chosen": -0.5445702075958252,
"logps/rejected": -36.77948760986328,
"loss": 0.3219444751739502,
"memory(GiB)": 45.64,
"nll_loss": 0.10567262023687363,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28718090057373047,
"rewards/margins": 2.473656415939331,
"rewards/rejected": -2.1864752769470215,
"step": 254,
"train_speed(iter/s)": 0.021259
},
{
"epoch": 0.5150214592274678,
"grad_norm": 1.7103385925292969,
"learning_rate": 0.00017743339024942135,
"logits/chosen": -0.8364546298980713,
"logits/rejected": -0.9355967044830322,
"logps/chosen": -1.8402678966522217,
"logps/rejected": -41.97530746459961,
"loss": 0.3561093807220459,
"memory(GiB)": 45.64,
"nll_loss": 0.15152454376220703,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3776871860027313,
"rewards/margins": 3.4742887020111084,
"rewards/rejected": -3.096601963043213,
"step": 255,
"train_speed(iter/s)": 0.02126
},
{
"epoch": 0.5170411512244383,
"grad_norm": 5.862149238586426,
"learning_rate": 0.00017722147645745468,
"logits/chosen": -0.8007981777191162,
"logits/rejected": -0.9000130891799927,
"logps/chosen": -4.51971435546875,
"logps/rejected": -49.85738754272461,
"loss": 0.6844031810760498,
"memory(GiB)": 45.64,
"nll_loss": 0.23998194932937622,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.11539852619171143,
"rewards/margins": 3.546253204345703,
"rewards/rejected": -3.661651849746704,
"step": 256,
"train_speed(iter/s)": 0.021261
},
{
"epoch": 0.5190608432214088,
"grad_norm": 23.92522621154785,
"learning_rate": 0.0001770087001205418,
"logits/chosen": -0.7442535161972046,
"logits/rejected": -0.8944082260131836,
"logps/chosen": -5.961298942565918,
"logps/rejected": -71.44552612304688,
"loss": 1.19035804271698,
"memory(GiB)": 45.64,
"nll_loss": 0.7366040945053101,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.2813420295715332,
"rewards/margins": 4.797372817993164,
"rewards/rejected": -5.078714847564697,
"step": 257,
"train_speed(iter/s)": 0.021261
},
{
"epoch": 0.5210805352183792,
"grad_norm": 9.221707344055176,
"learning_rate": 0.00017679506361534215,
"logits/chosen": -0.8309729099273682,
"logits/rejected": -0.9244940280914307,
"logps/chosen": -3.6046130657196045,
"logps/rejected": -38.451324462890625,
"loss": 1.0726348161697388,
"memory(GiB)": 45.64,
"nll_loss": 0.5696147084236145,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.056192442774772644,
"rewards/margins": 2.7530393600463867,
"rewards/rejected": -2.6968469619750977,
"step": 258,
"train_speed(iter/s)": 0.021262
},
{
"epoch": 0.5231002272153497,
"grad_norm": 3.6904711723327637,
"learning_rate": 0.0001765805693281231,
"logits/chosen": -0.7574508786201477,
"logits/rejected": -0.8763286471366882,
"logps/chosen": -1.6263139247894287,
"logps/rejected": -46.19388198852539,
"loss": 0.5760003328323364,
"memory(GiB)": 45.64,
"nll_loss": 0.32455456256866455,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.25203612446784973,
"rewards/margins": 3.3660078048706055,
"rewards/rejected": -3.1139719486236572,
"step": 259,
"train_speed(iter/s)": 0.021263
},
{
"epoch": 0.5251199192123202,
"grad_norm": 6.571902751922607,
"learning_rate": 0.00017636521965473323,
"logits/chosen": -0.7622162103652954,
"logits/rejected": -0.8849962949752808,
"logps/chosen": -3.6163456439971924,
"logps/rejected": -57.187339782714844,
"loss": 0.513578474521637,
"memory(GiB)": 45.64,
"nll_loss": 0.28239667415618896,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.26628056168556213,
"rewards/margins": 4.149145603179932,
"rewards/rejected": -3.8828649520874023,
"step": 260,
"train_speed(iter/s)": 0.021263
},
{
"epoch": 0.5271396112092905,
"grad_norm": 3.009442090988159,
"learning_rate": 0.00017614901700057552,
"logits/chosen": -0.7535040974617004,
"logits/rejected": -0.8197404146194458,
"logps/chosen": -1.611877679824829,
"logps/rejected": -36.75214767456055,
"loss": 0.4263669550418854,
"memory(GiB)": 45.64,
"nll_loss": 0.1808186173439026,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.355543851852417,
"rewards/margins": 2.128063678741455,
"rewards/rejected": -1.7725193500518799,
"step": 261,
"train_speed(iter/s)": 0.021264
},
{
"epoch": 0.529159303206261,
"grad_norm": 10.684004783630371,
"learning_rate": 0.0001759319637805806,
"logits/chosen": -0.7372271418571472,
"logits/rejected": -0.8281789422035217,
"logps/chosen": -1.6989682912826538,
"logps/rejected": -33.11771011352539,
"loss": 0.5836552381515503,
"memory(GiB)": 45.64,
"nll_loss": 0.24641528725624084,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.42360562086105347,
"rewards/margins": 2.2778561115264893,
"rewards/rejected": -1.8542505502700806,
"step": 262,
"train_speed(iter/s)": 0.021265
},
{
"epoch": 0.5311789952032315,
"grad_norm": 4.7525248527526855,
"learning_rate": 0.00017571406241917968,
"logits/chosen": -0.7032569646835327,
"logits/rejected": -0.8048897385597229,
"logps/chosen": -3.0269763469696045,
"logps/rejected": -29.489608764648438,
"loss": 0.5058411359786987,
"memory(GiB)": 45.64,
"nll_loss": 0.19841410219669342,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.27225935459136963,
"rewards/margins": 2.0580902099609375,
"rewards/rejected": -1.7858312129974365,
"step": 263,
"train_speed(iter/s)": 0.021265
},
{
"epoch": 0.5331986872002019,
"grad_norm": 2.464600086212158,
"learning_rate": 0.0001754953153502775,
"logits/chosen": -0.6921654939651489,
"logits/rejected": -0.8245174288749695,
"logps/chosen": -1.2894872426986694,
"logps/rejected": -41.8453369140625,
"loss": 0.36821237206459045,
"memory(GiB)": 45.64,
"nll_loss": 0.10888063907623291,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.26967915892601013,
"rewards/margins": 2.722353458404541,
"rewards/rejected": -2.452674150466919,
"step": 264,
"train_speed(iter/s)": 0.021265
},
{
"epoch": 0.5352183791971724,
"grad_norm": 3.666675329208374,
"learning_rate": 0.00017527572501722512,
"logits/chosen": -0.6526811718940735,
"logits/rejected": -0.8120133876800537,
"logps/chosen": -5.671820640563965,
"logps/rejected": -57.84872055053711,
"loss": 0.6365722417831421,
"memory(GiB)": 45.64,
"nll_loss": 0.44796761870384216,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.04257254675030708,
"rewards/margins": 3.3321990966796875,
"rewards/rejected": -3.289626121520996,
"step": 265,
"train_speed(iter/s)": 0.021266
},
{
"epoch": 0.5372380711941429,
"grad_norm": 5.50975227355957,
"learning_rate": 0.00017505529387279277,
"logits/chosen": -0.7191404104232788,
"logits/rejected": -0.7549193501472473,
"logps/chosen": -11.20957088470459,
"logps/rejected": -24.620988845825195,
"loss": 0.8978201746940613,
"memory(GiB)": 45.64,
"nll_loss": 0.3969779908657074,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.3098965585231781,
"rewards/margins": 1.0103328227996826,
"rewards/rejected": -1.320229411125183,
"step": 266,
"train_speed(iter/s)": 0.021266
},
{
"epoch": 0.5392577631911134,
"grad_norm": 9.796467781066895,
"learning_rate": 0.0001748340243791422,
"logits/chosen": -0.6914748549461365,
"logits/rejected": -0.8334357738494873,
"logps/chosen": -5.802427291870117,
"logps/rejected": -41.96017074584961,
"loss": 0.6360026597976685,
"memory(GiB)": 45.64,
"nll_loss": 0.3448495864868164,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2543778419494629,
"rewards/margins": 2.576064348220825,
"rewards/rejected": -2.321686267852783,
"step": 267,
"train_speed(iter/s)": 0.021266
},
{
"epoch": 0.5412774551880838,
"grad_norm": 4.284933567047119,
"learning_rate": 0.00017461191900779936,
"logits/chosen": -0.713287353515625,
"logits/rejected": -0.7692936658859253,
"logps/chosen": -4.46176290512085,
"logps/rejected": -30.945892333984375,
"loss": 0.5797103047370911,
"memory(GiB)": 45.64,
"nll_loss": 0.3343329429626465,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.1580563336610794,
"rewards/margins": 2.0286142826080322,
"rewards/rejected": -1.8705579042434692,
"step": 268,
"train_speed(iter/s)": 0.021267
},
{
"epoch": 0.5432971471850543,
"grad_norm": 3.172943353652954,
"learning_rate": 0.00017438898023962679,
"logits/chosen": -0.7907764911651611,
"logits/rejected": -0.8711207509040833,
"logps/chosen": -1.7791467905044556,
"logps/rejected": -29.88024139404297,
"loss": 0.33940574526786804,
"memory(GiB)": 45.64,
"nll_loss": 0.14780378341674805,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2693939208984375,
"rewards/margins": 2.3542535305023193,
"rewards/rejected": -2.0848593711853027,
"step": 269,
"train_speed(iter/s)": 0.021268
},
{
"epoch": 0.5453168391820248,
"grad_norm": 5.463645935058594,
"learning_rate": 0.00017416521056479577,
"logits/chosen": -0.7378922700881958,
"logits/rejected": -0.8519225120544434,
"logps/chosen": -5.347389221191406,
"logps/rejected": -35.428524017333984,
"loss": 0.6419250965118408,
"memory(GiB)": 45.64,
"nll_loss": 0.49513840675354004,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.09582029283046722,
"rewards/margins": 2.3689239025115967,
"rewards/rejected": -2.2731034755706787,
"step": 270,
"train_speed(iter/s)": 0.021269
},
{
"epoch": 0.5473365311789952,
"grad_norm": 2.791165828704834,
"learning_rate": 0.00017394061248275872,
"logits/chosen": -0.7984417080879211,
"logits/rejected": -0.8422114849090576,
"logps/chosen": -6.475491046905518,
"logps/rejected": -26.260494232177734,
"loss": 0.47203221917152405,
"memory(GiB)": 45.64,
"nll_loss": 0.23484748601913452,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4524388909339905,
"rewards/margins": 1.7292096614837646,
"rewards/rejected": -1.2767709493637085,
"step": 271,
"train_speed(iter/s)": 0.021269
},
{
"epoch": 0.5493562231759657,
"grad_norm": 2.7601311206817627,
"learning_rate": 0.00017371518850222112,
"logits/chosen": -0.7166031002998352,
"logits/rejected": -0.8156049251556396,
"logps/chosen": -1.3833684921264648,
"logps/rejected": -45.072750091552734,
"loss": 0.4653846323490143,
"memory(GiB)": 45.64,
"nll_loss": 0.185410737991333,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1616918444633484,
"rewards/margins": 2.9714224338531494,
"rewards/rejected": -2.8097305297851562,
"step": 272,
"train_speed(iter/s)": 0.021269
},
{
"epoch": 0.5513759151729362,
"grad_norm": 4.9853434562683105,
"learning_rate": 0.00017348894114111344,
"logits/chosen": -0.7632589340209961,
"logits/rejected": -0.7834702730178833,
"logps/chosen": -5.120803356170654,
"logps/rejected": -20.066801071166992,
"loss": 0.7621564865112305,
"memory(GiB)": 45.64,
"nll_loss": 0.39412054419517517,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09666721522808075,
"rewards/margins": 1.2335360050201416,
"rewards/rejected": -1.1368687152862549,
"step": 273,
"train_speed(iter/s)": 0.02127
},
{
"epoch": 0.5533956071699065,
"grad_norm": 6.144747734069824,
"learning_rate": 0.00017326187292656333,
"logits/chosen": -0.7423402070999146,
"logits/rejected": -0.8353608846664429,
"logps/chosen": -3.019026756286621,
"logps/rejected": -38.725494384765625,
"loss": 0.4919193685054779,
"memory(GiB)": 45.64,
"nll_loss": 0.29635170102119446,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20840522646903992,
"rewards/margins": 2.5846292972564697,
"rewards/rejected": -2.3762240409851074,
"step": 274,
"train_speed(iter/s)": 0.021271
},
{
"epoch": 0.555415299166877,
"grad_norm": 5.072936058044434,
"learning_rate": 0.00017303398639486695,
"logits/chosen": -0.8050971627235413,
"logits/rejected": -0.8979619741439819,
"logps/chosen": -3.597996473312378,
"logps/rejected": -38.68907165527344,
"loss": 0.6185693144798279,
"memory(GiB)": 45.64,
"nll_loss": 0.36338648200035095,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.04303528368473053,
"rewards/margins": 2.610353946685791,
"rewards/rejected": -2.567318916320801,
"step": 275,
"train_speed(iter/s)": 0.021272
},
{
"epoch": 0.5574349911638475,
"grad_norm": 4.154740810394287,
"learning_rate": 0.00017280528409146094,
"logits/chosen": -0.8580950498580933,
"logits/rejected": -0.9338577389717102,
"logps/chosen": -1.9045888185501099,
"logps/rejected": -29.787948608398438,
"loss": 0.6412729024887085,
"memory(GiB)": 45.64,
"nll_loss": 0.2939704358577728,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12071260064840317,
"rewards/margins": 2.376711130142212,
"rewards/rejected": -2.255998373031616,
"step": 276,
"train_speed(iter/s)": 0.021272
},
{
"epoch": 0.5594546831608179,
"grad_norm": 4.429795265197754,
"learning_rate": 0.00017257576857089397,
"logits/chosen": -0.7823255658149719,
"logits/rejected": -0.8295686841011047,
"logps/chosen": -6.783672332763672,
"logps/rejected": -42.67618942260742,
"loss": 0.5918665528297424,
"memory(GiB)": 45.64,
"nll_loss": 0.3899191915988922,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.04123719036579132,
"rewards/margins": 2.868664503097534,
"rewards/rejected": -2.827427387237549,
"step": 277,
"train_speed(iter/s)": 0.021273
},
{
"epoch": 0.5614743751577884,
"grad_norm": 3.5302765369415283,
"learning_rate": 0.00017234544239679806,
"logits/chosen": -0.7818064093589783,
"logits/rejected": -0.8903212547302246,
"logps/chosen": -1.2885193824768066,
"logps/rejected": -25.56497573852539,
"loss": 0.5648685693740845,
"memory(GiB)": 45.64,
"nll_loss": 0.20888982713222504,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.252044677734375,
"rewards/margins": 1.763919472694397,
"rewards/rejected": -1.5118746757507324,
"step": 278,
"train_speed(iter/s)": 0.021274
},
{
"epoch": 0.5634940671547589,
"grad_norm": 1.8682705163955688,
"learning_rate": 0.0001721143081418601,
"logits/chosen": -0.6173131465911865,
"logits/rejected": -0.7885771989822388,
"logps/chosen": -0.348890095949173,
"logps/rejected": -61.137290954589844,
"loss": 0.2171340137720108,
"memory(GiB)": 45.64,
"nll_loss": 0.0689445212483406,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4386233389377594,
"rewards/margins": 4.034773826599121,
"rewards/rejected": -3.5961508750915527,
"step": 279,
"train_speed(iter/s)": 0.021274
},
{
"epoch": 0.5655137591517294,
"grad_norm": 1.9534425735473633,
"learning_rate": 0.00017188236838779295,
"logits/chosen": -0.6642014384269714,
"logits/rejected": -0.8017529249191284,
"logps/chosen": -1.7374509572982788,
"logps/rejected": -56.20750427246094,
"loss": 0.22880004346370697,
"memory(GiB)": 45.64,
"nll_loss": 0.09635397791862488,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3913995027542114,
"rewards/margins": 3.391270160675049,
"rewards/rejected": -2.999870777130127,
"step": 280,
"train_speed(iter/s)": 0.021273
},
{
"epoch": 0.5675334511486998,
"grad_norm": 6.31340217590332,
"learning_rate": 0.0001716496257253068,
"logits/chosen": -0.7913269996643066,
"logits/rejected": -0.9220376014709473,
"logps/chosen": -3.3653981685638428,
"logps/rejected": -47.17043685913086,
"loss": 0.7093809843063354,
"memory(GiB)": 45.64,
"nll_loss": 0.40024468302726746,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22013141214847565,
"rewards/margins": 3.3141214847564697,
"rewards/rejected": -3.0939903259277344,
"step": 281,
"train_speed(iter/s)": 0.021274
},
{
"epoch": 0.5695531431456703,
"grad_norm": 2.4428505897521973,
"learning_rate": 0.00017141608275408006,
"logits/chosen": -0.8131429553031921,
"logits/rejected": -0.9399922490119934,
"logps/chosen": -1.98673415184021,
"logps/rejected": -42.24494552612305,
"loss": 0.4994111657142639,
"memory(GiB)": 45.64,
"nll_loss": 0.2407137006521225,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18601495027542114,
"rewards/margins": 2.6695024967193604,
"rewards/rejected": -2.483487367630005,
"step": 282,
"train_speed(iter/s)": 0.021274
},
{
"epoch": 0.5715728351426408,
"grad_norm": 1.5563158988952637,
"learning_rate": 0.0001711817420827305,
"logits/chosen": -0.6783189177513123,
"logits/rejected": -0.9088720083236694,
"logps/chosen": -0.37805676460266113,
"logps/rejected": -64.65815734863281,
"loss": 0.18766579031944275,
"memory(GiB)": 45.64,
"nll_loss": 0.08086632192134857,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3040025234222412,
"rewards/margins": 4.409641265869141,
"rewards/rejected": -4.10563850402832,
"step": 283,
"train_speed(iter/s)": 0.021275
},
{
"epoch": 0.5735925271396112,
"grad_norm": 7.082139015197754,
"learning_rate": 0.00017094660632878582,
"logits/chosen": -0.7040260434150696,
"logits/rejected": -0.7696897387504578,
"logps/chosen": -8.167627334594727,
"logps/rejected": -38.17253112792969,
"loss": 0.9717364311218262,
"memory(GiB)": 45.64,
"nll_loss": 0.5700907111167908,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.012362787500023842,
"rewards/margins": 2.3398733139038086,
"rewards/rejected": -2.327510356903076,
"step": 284,
"train_speed(iter/s)": 0.021275
},
{
"epoch": 0.5756122191365817,
"grad_norm": 5.067822456359863,
"learning_rate": 0.00017071067811865476,
"logits/chosen": -0.802982747554779,
"logits/rejected": -0.8972690105438232,
"logps/chosen": -2.8758363723754883,
"logps/rejected": -46.713172912597656,
"loss": 0.5463993549346924,
"memory(GiB)": 45.64,
"nll_loss": 0.284506618976593,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16443192958831787,
"rewards/margins": 3.5550990104675293,
"rewards/rejected": -3.3906667232513428,
"step": 285,
"train_speed(iter/s)": 0.021275
},
{
"epoch": 0.5776319111335522,
"grad_norm": 4.077809810638428,
"learning_rate": 0.00017047396008759754,
"logits/chosen": -0.8403116464614868,
"logits/rejected": -0.8808307647705078,
"logps/chosen": -6.7314581871032715,
"logps/rejected": -30.9017333984375,
"loss": 0.6438797116279602,
"memory(GiB)": 45.64,
"nll_loss": 0.3068145215511322,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.03903551399707794,
"rewards/margins": 1.8479769229888916,
"rewards/rejected": -1.887012243270874,
"step": 286,
"train_speed(iter/s)": 0.021276
},
{
"epoch": 0.5796516031305226,
"grad_norm": 2.9939074516296387,
"learning_rate": 0.00017023645487969645,
"logits/chosen": -0.7674691081047058,
"logits/rejected": -0.8917283415794373,
"logps/chosen": -3.4815213680267334,
"logps/rejected": -56.125099182128906,
"loss": 0.29649537801742554,
"memory(GiB)": 45.64,
"nll_loss": 0.15909157693386078,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16410662233829498,
"rewards/margins": 4.206541061401367,
"rewards/rejected": -4.042433738708496,
"step": 287,
"train_speed(iter/s)": 0.021276
},
{
"epoch": 0.581671295127493,
"grad_norm": 12.105512619018555,
"learning_rate": 0.00016999816514782647,
"logits/chosen": -0.7554559707641602,
"logits/rejected": -0.8941792845726013,
"logps/chosen": -6.372040271759033,
"logps/rejected": -39.95315170288086,
"loss": 1.1656122207641602,
"memory(GiB)": 45.64,
"nll_loss": 0.6600521206855774,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.05390087515115738,
"rewards/margins": 2.4357922077178955,
"rewards/rejected": -2.4896934032440186,
"step": 288,
"train_speed(iter/s)": 0.021277
},
{
"epoch": 0.5836909871244635,
"grad_norm": 5.215820789337158,
"learning_rate": 0.0001697590935536254,
"logits/chosen": -0.8481535911560059,
"logits/rejected": -0.9250099062919617,
"logps/chosen": -2.248663902282715,
"logps/rejected": -45.463008880615234,
"loss": 0.4629695415496826,
"memory(GiB)": 45.64,
"nll_loss": 0.22682401537895203,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.0752679854631424,
"rewards/margins": 3.593411922454834,
"rewards/rejected": -3.5181431770324707,
"step": 289,
"train_speed(iter/s)": 0.021278
},
{
"epoch": 0.5857106791214339,
"grad_norm": 7.402690887451172,
"learning_rate": 0.00016951924276746425,
"logits/chosen": -0.5944700241088867,
"logits/rejected": -0.7739753723144531,
"logps/chosen": -8.305325508117676,
"logps/rejected": -56.55354690551758,
"loss": 1.023478627204895,
"memory(GiB)": 45.64,
"nll_loss": 0.5631112456321716,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.024727948009967804,
"rewards/margins": 3.671443462371826,
"rewards/rejected": -3.696171522140503,
"step": 290,
"train_speed(iter/s)": 0.021277
},
{
"epoch": 0.5877303711184044,
"grad_norm": 9.028773307800293,
"learning_rate": 0.00016927861546841747,
"logits/chosen": -0.827506959438324,
"logits/rejected": -0.8843482136726379,
"logps/chosen": -3.57808256149292,
"logps/rejected": -27.147445678710938,
"loss": 0.9430906772613525,
"memory(GiB)": 45.64,
"nll_loss": 0.36645135283470154,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07185473293066025,
"rewards/margins": 1.882130742073059,
"rewards/rejected": -1.810275912284851,
"step": 291,
"train_speed(iter/s)": 0.021278
},
{
"epoch": 0.5897500631153749,
"grad_norm": 3.0350229740142822,
"learning_rate": 0.00016903721434423306,
"logits/chosen": -0.9094471335411072,
"logits/rejected": -0.9361112713813782,
"logps/chosen": -2.4875197410583496,
"logps/rejected": -24.18358612060547,
"loss": 0.4315643012523651,
"memory(GiB)": 45.64,
"nll_loss": 0.24477659165859222,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3049478530883789,
"rewards/margins": 2.156770706176758,
"rewards/rejected": -1.8518224954605103,
"step": 292,
"train_speed(iter/s)": 0.021279
},
{
"epoch": 0.5917697551123454,
"grad_norm": 4.291833877563477,
"learning_rate": 0.0001687950420913022,
"logits/chosen": -0.7475178241729736,
"logits/rejected": -0.8380208015441895,
"logps/chosen": -3.275129795074463,
"logps/rejected": -32.63922882080078,
"loss": 0.6617104411125183,
"memory(GiB)": 45.64,
"nll_loss": 0.4119285047054291,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08241842687129974,
"rewards/margins": 2.206611394882202,
"rewards/rejected": -2.124192953109741,
"step": 293,
"train_speed(iter/s)": 0.02128
},
{
"epoch": 0.5937894471093158,
"grad_norm": 4.568887710571289,
"learning_rate": 0.00016855210141462963,
"logits/chosen": -0.7708112001419067,
"logits/rejected": -0.8631462454795837,
"logps/chosen": -2.731691837310791,
"logps/rejected": -34.596675872802734,
"loss": 0.5602784156799316,
"memory(GiB)": 45.64,
"nll_loss": 0.3268437683582306,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27219781279563904,
"rewards/margins": 2.2604424953460693,
"rewards/rejected": -1.9882445335388184,
"step": 294,
"train_speed(iter/s)": 0.02128
},
{
"epoch": 0.5958091391062863,
"grad_norm": 4.01273250579834,
"learning_rate": 0.0001683083950278031,
"logits/chosen": -0.8505802750587463,
"logits/rejected": -0.9058212637901306,
"logps/chosen": -1.9776384830474854,
"logps/rejected": -29.04343605041504,
"loss": 0.5075977444648743,
"memory(GiB)": 45.64,
"nll_loss": 0.26625630259513855,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16404712200164795,
"rewards/margins": 2.069391965866089,
"rewards/rejected": -1.905344843864441,
"step": 295,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.5978288311032568,
"grad_norm": 2.308389186859131,
"learning_rate": 0.00016806392565296311,
"logits/chosen": -0.7509005665779114,
"logits/rejected": -0.8670397996902466,
"logps/chosen": -2.6714932918548584,
"logps/rejected": -31.49539566040039,
"loss": 0.4104999899864197,
"memory(GiB)": 45.64,
"nll_loss": 0.14024530351161957,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3330576419830322,
"rewards/margins": 1.9010692834854126,
"rewards/rejected": -1.5680116415023804,
"step": 296,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.5998485231002272,
"grad_norm": 7.128021717071533,
"learning_rate": 0.00016781869602077264,
"logits/chosen": -0.7379200458526611,
"logits/rejected": -0.8878840804100037,
"logps/chosen": -3.651395320892334,
"logps/rejected": -39.45635986328125,
"loss": 0.8120747208595276,
"memory(GiB)": 45.64,
"nll_loss": 0.46895888447761536,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07825376093387604,
"rewards/margins": 1.777091145515442,
"rewards/rejected": -1.698837399482727,
"step": 297,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.6018682150971977,
"grad_norm": 3.926884651184082,
"learning_rate": 0.00016757270887038654,
"logits/chosen": -0.7688292264938354,
"logits/rejected": -0.9089186191558838,
"logps/chosen": -1.3693759441375732,
"logps/rejected": -37.80522918701172,
"loss": 0.4208237826824188,
"memory(GiB)": 45.64,
"nll_loss": 0.17390652000904083,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1809903383255005,
"rewards/margins": 2.1318840980529785,
"rewards/rejected": -1.9508938789367676,
"step": 298,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.6038879070941682,
"grad_norm": 3.3669636249542236,
"learning_rate": 0.00016732596694942083,
"logits/chosen": -0.74614417552948,
"logits/rejected": -0.8711810111999512,
"logps/chosen": -4.000098705291748,
"logps/rejected": -40.62786102294922,
"loss": 0.5480436682701111,
"memory(GiB)": 45.64,
"nll_loss": 0.23701626062393188,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11138585954904556,
"rewards/margins": 1.9405393600463867,
"rewards/rejected": -1.8291537761688232,
"step": 299,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.6059075990911386,
"grad_norm": 2.457587480545044,
"learning_rate": 0.00016707847301392236,
"logits/chosen": -0.8123277425765991,
"logits/rejected": -0.9144627451896667,
"logps/chosen": -4.013862133026123,
"logps/rejected": -33.994991302490234,
"loss": 0.5886133909225464,
"memory(GiB)": 45.64,
"nll_loss": 0.31008380651474,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23923330008983612,
"rewards/margins": 2.1191067695617676,
"rewards/rejected": -1.879873514175415,
"step": 300,
"train_speed(iter/s)": 0.021282
},
{
"epoch": 0.6059075990911386,
"eval_logits/chosen": -0.8244539499282837,
"eval_logits/rejected": -0.9301112294197083,
"eval_logps/chosen": -2.4614338874816895,
"eval_logps/rejected": -37.376708984375,
"eval_loss": 0.5653835535049438,
"eval_nll_loss": 0.26967209577560425,
"eval_rewards/accuracies": 0.862500011920929,
"eval_rewards/chosen": 0.19960978627204895,
"eval_rewards/margins": 2.2363221645355225,
"eval_rewards/rejected": -2.036712169647217,
"eval_runtime": 92.5823,
"eval_samples_per_second": 0.864,
"eval_steps_per_second": 0.432,
"step": 300
},
{
"epoch": 0.6079272910881091,
"grad_norm": 1.4425960779190063,
"learning_rate": 0.00016683022982833757,
"logits/chosen": -0.9167453050613403,
"logits/rejected": -0.9786884784698486,
"logps/chosen": -0.2554780840873718,
"logps/rejected": -30.395259857177734,
"loss": 0.28913912177085876,
"memory(GiB)": 45.64,
"nll_loss": 0.056439101696014404,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2730258107185364,
"rewards/margins": 2.289043664932251,
"rewards/rejected": -2.0160179138183594,
"step": 301,
"train_speed(iter/s)": 0.021119
},
{
"epoch": 0.6099469830850796,
"grad_norm": 2.9968175888061523,
"learning_rate": 0.00016658124016548197,
"logits/chosen": -0.9765443801879883,
"logits/rejected": -1.0245364904403687,
"logps/chosen": -1.0650570392608643,
"logps/rejected": -35.4031867980957,
"loss": 0.43358710408210754,
"memory(GiB)": 45.64,
"nll_loss": 0.18546591699123383,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2088906615972519,
"rewards/margins": 2.796689748764038,
"rewards/rejected": -2.587799310684204,
"step": 302,
"train_speed(iter/s)": 0.021121
},
{
"epoch": 0.6119666750820499,
"grad_norm": 4.542461395263672,
"learning_rate": 0.000166331506806509,
"logits/chosen": -0.9329476356506348,
"logits/rejected": -1.0012348890304565,
"logps/chosen": -2.2945432662963867,
"logps/rejected": -31.613216400146484,
"loss": 0.5403211116790771,
"memory(GiB)": 45.64,
"nll_loss": 0.2446451485157013,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2515539526939392,
"rewards/margins": 2.3975443840026855,
"rewards/rejected": -2.1459906101226807,
"step": 303,
"train_speed(iter/s)": 0.021123
},
{
"epoch": 0.6139863670790204,
"grad_norm": 3.4531707763671875,
"learning_rate": 0.00016608103254087906,
"logits/chosen": -0.7963448762893677,
"logits/rejected": -0.9296629428863525,
"logps/chosen": -3.21559476852417,
"logps/rejected": -49.27157211303711,
"loss": 0.5262452363967896,
"memory(GiB)": 45.64,
"nll_loss": 0.2854577302932739,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08577384054660797,
"rewards/margins": 3.5433404445648193,
"rewards/rejected": -3.457566261291504,
"step": 304,
"train_speed(iter/s)": 0.021123
},
{
"epoch": 0.6160060590759909,
"grad_norm": 5.113759994506836,
"learning_rate": 0.00016582982016632818,
"logits/chosen": -0.7916707396507263,
"logits/rejected": -0.934760570526123,
"logps/chosen": -2.8785698413848877,
"logps/rejected": -56.01650619506836,
"loss": 0.6735590100288391,
"memory(GiB)": 45.64,
"nll_loss": 0.42455944418907166,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24037745594978333,
"rewards/margins": 3.957566261291504,
"rewards/rejected": -3.717188835144043,
"step": 305,
"train_speed(iter/s)": 0.021124
},
{
"epoch": 0.6180257510729614,
"grad_norm": 1.8782538175582886,
"learning_rate": 0.00016557787248883696,
"logits/chosen": -0.8707424402236938,
"logits/rejected": -0.9912842512130737,
"logps/chosen": -1.2852058410644531,
"logps/rejected": -55.1501579284668,
"loss": 0.26773229241371155,
"memory(GiB)": 45.64,
"nll_loss": 0.11378525197505951,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.32057979702949524,
"rewards/margins": 4.313370227813721,
"rewards/rejected": -3.992790460586548,
"step": 306,
"train_speed(iter/s)": 0.021124
},
{
"epoch": 0.6200454430699318,
"grad_norm": 12.83481216430664,
"learning_rate": 0.00016532519232259916,
"logits/chosen": -0.8531877398490906,
"logits/rejected": -0.9290578365325928,
"logps/chosen": -3.8104918003082275,
"logps/rejected": -58.618621826171875,
"loss": 0.3679554760456085,
"memory(GiB)": 45.64,
"nll_loss": 0.2755557596683502,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2785298526287079,
"rewards/margins": 4.633764743804932,
"rewards/rejected": -4.355234622955322,
"step": 307,
"train_speed(iter/s)": 0.021125
},
{
"epoch": 0.6220651350669023,
"grad_norm": 3.644946336746216,
"learning_rate": 0.00016507178248999024,
"logits/chosen": -0.8718377947807312,
"logits/rejected": -1.0232672691345215,
"logps/chosen": -1.1764187812805176,
"logps/rejected": -66.40010070800781,
"loss": 0.4798681139945984,
"memory(GiB)": 45.64,
"nll_loss": 0.2249489575624466,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.23639193177223206,
"rewards/margins": 4.824877738952637,
"rewards/rejected": -4.5884857177734375,
"step": 308,
"train_speed(iter/s)": 0.021126
},
{
"epoch": 0.6240848270638728,
"grad_norm": 3.6663687229156494,
"learning_rate": 0.00016481764582153586,
"logits/chosen": -0.8408634066581726,
"logits/rejected": -0.9267845153808594,
"logps/chosen": -4.433281898498535,
"logps/rejected": -32.701011657714844,
"loss": 0.47992053627967834,
"memory(GiB)": 45.64,
"nll_loss": 0.21022652089595795,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5157691240310669,
"rewards/margins": 2.2275538444519043,
"rewards/rejected": -1.7117843627929688,
"step": 309,
"train_speed(iter/s)": 0.021127
},
{
"epoch": 0.6261045190608432,
"grad_norm": 8.538496017456055,
"learning_rate": 0.00016456278515588024,
"logits/chosen": -0.8827572464942932,
"logits/rejected": -0.9595881700515747,
"logps/chosen": -5.372483253479004,
"logps/rejected": -43.774436950683594,
"loss": 0.74099200963974,
"memory(GiB)": 45.64,
"nll_loss": 0.4238053560256958,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08053889870643616,
"rewards/margins": 2.704007148742676,
"rewards/rejected": -2.6234686374664307,
"step": 310,
"train_speed(iter/s)": 0.021128
},
{
"epoch": 0.6281242110578137,
"grad_norm": 3.513566493988037,
"learning_rate": 0.00016430720333975452,
"logits/chosen": -0.8878616094589233,
"logits/rejected": -0.9629725217819214,
"logps/chosen": -2.4065513610839844,
"logps/rejected": -43.71923065185547,
"loss": 0.4641585052013397,
"memory(GiB)": 45.64,
"nll_loss": 0.2343730330467224,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1930648535490036,
"rewards/margins": 3.418928623199463,
"rewards/rejected": -3.2258636951446533,
"step": 311,
"train_speed(iter/s)": 0.021129
},
{
"epoch": 0.6301439030547842,
"grad_norm": 6.264689922332764,
"learning_rate": 0.00016405090322794483,
"logits/chosen": -0.9043357968330383,
"logits/rejected": -0.9985758066177368,
"logps/chosen": -2.7129530906677246,
"logps/rejected": -41.665489196777344,
"loss": 0.6599389910697937,
"memory(GiB)": 45.64,
"nll_loss": 0.3321758210659027,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.17053501307964325,
"rewards/margins": 2.564326047897339,
"rewards/rejected": -2.3937911987304688,
"step": 312,
"train_speed(iter/s)": 0.021131
},
{
"epoch": 0.6321635950517546,
"grad_norm": 22.02393913269043,
"learning_rate": 0.00016379388768326063,
"logits/chosen": -0.8338424563407898,
"logits/rejected": -0.9313662052154541,
"logps/chosen": -4.164543151855469,
"logps/rejected": -50.46995544433594,
"loss": 1.0124552249908447,
"memory(GiB)": 45.64,
"nll_loss": 0.6529191732406616,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.016213715076446533,
"rewards/margins": 3.471205949783325,
"rewards/rejected": -3.4549922943115234,
"step": 313,
"train_speed(iter/s)": 0.021131
},
{
"epoch": 0.6341832870487251,
"grad_norm": 10.904000282287598,
"learning_rate": 0.00016353615957650236,
"logits/chosen": -0.7540192008018494,
"logits/rejected": -0.8433898687362671,
"logps/chosen": -10.264131546020508,
"logps/rejected": -41.65949630737305,
"loss": 0.5326629877090454,
"memory(GiB)": 45.64,
"nll_loss": 0.239348366856575,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.253826379776001,
"rewards/margins": 2.7431883811950684,
"rewards/rejected": -2.4893617630004883,
"step": 314,
"train_speed(iter/s)": 0.021131
},
{
"epoch": 0.6362029790456956,
"grad_norm": 3.1705944538116455,
"learning_rate": 0.00016327772178642986,
"logits/chosen": -0.9517133831977844,
"logits/rejected": -1.0139639377593994,
"logps/chosen": -0.973305344581604,
"logps/rejected": -38.540000915527344,
"loss": 0.3936949670314789,
"memory(GiB)": 45.64,
"nll_loss": 0.1697213351726532,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.20970085263252258,
"rewards/margins": 3.3330564498901367,
"rewards/rejected": -3.1233556270599365,
"step": 315,
"train_speed(iter/s)": 0.021133
},
{
"epoch": 0.638222671042666,
"grad_norm": 5.624232769012451,
"learning_rate": 0.00016301857719972976,
"logits/chosen": -0.8001008629798889,
"logits/rejected": -0.8618478775024414,
"logps/chosen": -1.4323068857192993,
"logps/rejected": -35.56591033935547,
"loss": 0.4376400411128998,
"memory(GiB)": 45.64,
"nll_loss": 0.14159713685512543,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20484629273414612,
"rewards/margins": 2.43072247505188,
"rewards/rejected": -2.2258763313293457,
"step": 316,
"train_speed(iter/s)": 0.021134
},
{
"epoch": 0.6402423630396364,
"grad_norm": 7.583630561828613,
"learning_rate": 0.0001627587287109836,
"logits/chosen": -0.8299413919448853,
"logits/rejected": -0.9769677519798279,
"logps/chosen": -3.7215254306793213,
"logps/rejected": -60.84526062011719,
"loss": 0.5378049612045288,
"memory(GiB)": 45.64,
"nll_loss": 0.32689476013183594,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.025372333824634552,
"rewards/margins": 4.722233295440674,
"rewards/rejected": -4.6968607902526855,
"step": 317,
"train_speed(iter/s)": 0.021135
},
{
"epoch": 0.6422620550366069,
"grad_norm": 8.251932144165039,
"learning_rate": 0.00016249817922263517,
"logits/chosen": -0.8568125367164612,
"logits/rejected": -0.931611955165863,
"logps/chosen": -5.391039848327637,
"logps/rejected": -45.42852020263672,
"loss": 0.5377641916275024,
"memory(GiB)": 45.64,
"nll_loss": 0.29841428995132446,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.31022340059280396,
"rewards/margins": 3.579132080078125,
"rewards/rejected": -3.268908977508545,
"step": 318,
"train_speed(iter/s)": 0.021135
},
{
"epoch": 0.6442817470335774,
"grad_norm": 4.026428699493408,
"learning_rate": 0.00016223693164495835,
"logits/chosen": -0.77679044008255,
"logits/rejected": -0.8818118572235107,
"logps/chosen": -5.223626136779785,
"logps/rejected": -46.39476013183594,
"loss": 0.5932655930519104,
"memory(GiB)": 45.64,
"nll_loss": 0.30503058433532715,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.009123122319579124,
"rewards/margins": 3.3854122161865234,
"rewards/rejected": -3.3945353031158447,
"step": 319,
"train_speed(iter/s)": 0.021136
},
{
"epoch": 0.6463014390305478,
"grad_norm": 3.859316110610962,
"learning_rate": 0.00016197498889602448,
"logits/chosen": -0.9226962924003601,
"logits/rejected": -0.984259843826294,
"logps/chosen": -0.3310558497905731,
"logps/rejected": -39.15312576293945,
"loss": 0.21047677099704742,
"memory(GiB)": 45.64,
"nll_loss": 0.053509388118982315,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.37339526414871216,
"rewards/margins": 3.054718494415283,
"rewards/rejected": -2.681323289871216,
"step": 320,
"train_speed(iter/s)": 0.021137
},
{
"epoch": 0.6483211310275183,
"grad_norm": 4.3604888916015625,
"learning_rate": 0.00016171235390166985,
"logits/chosen": -0.9235320687294006,
"logits/rejected": -0.9902734160423279,
"logps/chosen": -2.538111448287964,
"logps/rejected": -48.80242156982422,
"loss": 0.5195378661155701,
"memory(GiB)": 45.64,
"nll_loss": 0.23220032453536987,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.17571590840816498,
"rewards/margins": 3.9404807090759277,
"rewards/rejected": -3.7647647857666016,
"step": 321,
"train_speed(iter/s)": 0.021138
},
{
"epoch": 0.6503408230244888,
"grad_norm": 9.97143268585205,
"learning_rate": 0.00016144902959546286,
"logits/chosen": -0.9121385216712952,
"logits/rejected": -0.9658838510513306,
"logps/chosen": -5.540125846862793,
"logps/rejected": -45.613990783691406,
"loss": 0.8853093385696411,
"memory(GiB)": 45.64,
"nll_loss": 0.35688427090644836,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.05821647495031357,
"rewards/margins": 3.1649882793426514,
"rewards/rejected": -3.2232048511505127,
"step": 322,
"train_speed(iter/s)": 0.021139
},
{
"epoch": 0.6523605150214592,
"grad_norm": 4.8883819580078125,
"learning_rate": 0.0001611850189186714,
"logits/chosen": -0.9210085868835449,
"logits/rejected": -0.9733687043190002,
"logps/chosen": -4.037269592285156,
"logps/rejected": -41.21742630004883,
"loss": 0.5509124398231506,
"memory(GiB)": 45.64,
"nll_loss": 0.32746627926826477,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21709240972995758,
"rewards/margins": 3.416368246078491,
"rewards/rejected": -3.199275493621826,
"step": 323,
"train_speed(iter/s)": 0.02114
},
{
"epoch": 0.6543802070184297,
"grad_norm": 2.4553871154785156,
"learning_rate": 0.00016092032482023,
"logits/chosen": -0.9412962794303894,
"logits/rejected": -1.0209475755691528,
"logps/chosen": -0.632290244102478,
"logps/rejected": -33.6468505859375,
"loss": 0.23645614087581635,
"memory(GiB)": 45.64,
"nll_loss": 0.07834430038928986,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.43455106019973755,
"rewards/margins": 3.022073745727539,
"rewards/rejected": -2.587522506713867,
"step": 324,
"train_speed(iter/s)": 0.021142
},
{
"epoch": 0.6563998990154002,
"grad_norm": 2.446058511734009,
"learning_rate": 0.00016065495025670675,
"logits/chosen": -0.8765738606452942,
"logits/rejected": -0.9390391111373901,
"logps/chosen": -5.492425918579102,
"logps/rejected": -34.9351692199707,
"loss": 0.5046104788780212,
"memory(GiB)": 45.64,
"nll_loss": 0.34279099106788635,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22330977022647858,
"rewards/margins": 2.7527146339416504,
"rewards/rejected": -2.529404878616333,
"step": 325,
"train_speed(iter/s)": 0.021143
},
{
"epoch": 0.6584195910123706,
"grad_norm": 18.5092716217041,
"learning_rate": 0.00016038889819227045,
"logits/chosen": -0.8468933701515198,
"logits/rejected": -0.9487016201019287,
"logps/chosen": -1.3551874160766602,
"logps/rejected": -38.7204475402832,
"loss": 0.4489996135234833,
"memory(GiB)": 45.64,
"nll_loss": 0.2548639476299286,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3463600277900696,
"rewards/margins": 2.8273019790649414,
"rewards/rejected": -2.4809420108795166,
"step": 326,
"train_speed(iter/s)": 0.021144
},
{
"epoch": 0.6604392830093411,
"grad_norm": 6.140425682067871,
"learning_rate": 0.00016012217159865739,
"logits/chosen": -0.8302001357078552,
"logits/rejected": -0.924152135848999,
"logps/chosen": -3.6062324047088623,
"logps/rejected": -56.65538787841797,
"loss": 0.784902811050415,
"memory(GiB)": 45.64,
"nll_loss": 0.3868030309677124,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.006980091333389282,
"rewards/margins": 3.1850905418395996,
"rewards/rejected": -3.178110122680664,
"step": 327,
"train_speed(iter/s)": 0.021144
},
{
"epoch": 0.6624589750063116,
"grad_norm": 2.915184259414673,
"learning_rate": 0.00015985477345513817,
"logits/chosen": -0.7988994121551514,
"logits/rejected": -0.9357851147651672,
"logps/chosen": -5.732859134674072,
"logps/rejected": -39.42655944824219,
"loss": 0.347720742225647,
"memory(GiB)": 45.64,
"nll_loss": 0.16449037194252014,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.23062925040721893,
"rewards/margins": 2.8876638412475586,
"rewards/rejected": -2.6570348739624023,
"step": 328,
"train_speed(iter/s)": 0.021145
},
{
"epoch": 0.664478667003282,
"grad_norm": 7.8771162033081055,
"learning_rate": 0.00015958670674848442,
"logits/chosen": -0.857587456703186,
"logits/rejected": -0.9888629913330078,
"logps/chosen": -6.550410270690918,
"logps/rejected": -41.466896057128906,
"loss": 0.709037184715271,
"memory(GiB)": 45.64,
"nll_loss": 0.40757060050964355,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.43693459033966064,
"rewards/margins": 2.189579486846924,
"rewards/rejected": -1.7526450157165527,
"step": 329,
"train_speed(iter/s)": 0.021145
},
{
"epoch": 0.6664983590002524,
"grad_norm": 19.00602149963379,
"learning_rate": 0.00015931797447293552,
"logits/chosen": -0.8882402181625366,
"logits/rejected": -0.9668765068054199,
"logps/chosen": -3.752054214477539,
"logps/rejected": -34.47447204589844,
"loss": 0.6838876605033875,
"memory(GiB)": 45.64,
"nll_loss": 0.4321058392524719,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22359441220760345,
"rewards/margins": 2.5547034740448,
"rewards/rejected": -2.331109046936035,
"step": 330,
"train_speed(iter/s)": 0.021146
},
{
"epoch": 0.668518050997223,
"grad_norm": 1.7641230821609497,
"learning_rate": 0.00015904857963016506,
"logits/chosen": -0.7825491428375244,
"logits/rejected": -0.9280312061309814,
"logps/chosen": -0.6239898204803467,
"logps/rejected": -43.15408706665039,
"loss": 0.24098820984363556,
"memory(GiB)": 45.64,
"nll_loss": 0.09237208962440491,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2947159707546234,
"rewards/margins": 3.279745578765869,
"rewards/rejected": -2.985029697418213,
"step": 331,
"train_speed(iter/s)": 0.021146
},
{
"epoch": 0.6705377429941933,
"grad_norm": 2.2421019077301025,
"learning_rate": 0.00015877852522924732,
"logits/chosen": -0.8130238652229309,
"logits/rejected": -0.9327349662780762,
"logps/chosen": -0.8687487244606018,
"logps/rejected": -47.515663146972656,
"loss": 0.2235592156648636,
"memory(GiB)": 45.64,
"nll_loss": 0.09912680834531784,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2986675500869751,
"rewards/margins": 3.4509923458099365,
"rewards/rejected": -3.152324914932251,
"step": 332,
"train_speed(iter/s)": 0.021147
},
{
"epoch": 0.6725574349911638,
"grad_norm": 8.463959693908691,
"learning_rate": 0.0001585078142866237,
"logits/chosen": -0.8485694527626038,
"logits/rejected": -0.9816790819168091,
"logps/chosen": -4.081976890563965,
"logps/rejected": -34.49391174316406,
"loss": 0.8111600279808044,
"memory(GiB)": 45.64,
"nll_loss": 0.5827361941337585,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.010378856211900711,
"rewards/margins": 2.1897881031036377,
"rewards/rejected": -2.1794090270996094,
"step": 333,
"train_speed(iter/s)": 0.021149
},
{
"epoch": 0.6745771269881343,
"grad_norm": 3.4926505088806152,
"learning_rate": 0.00015823644982606905,
"logits/chosen": -0.9417222142219543,
"logits/rejected": -1.0309451818466187,
"logps/chosen": -0.7485335469245911,
"logps/rejected": -33.3504524230957,
"loss": 0.307941198348999,
"memory(GiB)": 45.64,
"nll_loss": 0.09651970863342285,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.388710618019104,
"rewards/margins": 2.98738956451416,
"rewards/rejected": -2.5986788272857666,
"step": 334,
"train_speed(iter/s)": 0.02115
},
{
"epoch": 0.6765968189851048,
"grad_norm": 10.243365287780762,
"learning_rate": 0.00015796443487865776,
"logits/chosen": -0.909482479095459,
"logits/rejected": -0.9898862838745117,
"logps/chosen": -6.335696220397949,
"logps/rejected": -46.39136505126953,
"loss": 0.6261657476425171,
"memory(GiB)": 45.64,
"nll_loss": 0.43729183077812195,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27775925397872925,
"rewards/margins": 3.944711446762085,
"rewards/rejected": -3.666951894760132,
"step": 335,
"train_speed(iter/s)": 0.021151
},
{
"epoch": 0.6786165109820752,
"grad_norm": 7.904644012451172,
"learning_rate": 0.00015769177248273008,
"logits/chosen": -0.9360239505767822,
"logits/rejected": -1.049852967262268,
"logps/chosen": -7.70269250869751,
"logps/rejected": -51.02676773071289,
"loss": 0.8781910538673401,
"memory(GiB)": 45.64,
"nll_loss": 0.5348291397094727,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.07586444914340973,
"rewards/margins": 3.814580202102661,
"rewards/rejected": -3.738715648651123,
"step": 336,
"train_speed(iter/s)": 0.021152
},
{
"epoch": 0.6806362029790457,
"grad_norm": 16.91658592224121,
"learning_rate": 0.00015741846568385808,
"logits/chosen": -0.8461523652076721,
"logits/rejected": -1.0379836559295654,
"logps/chosen": -8.801255226135254,
"logps/rejected": -61.471771240234375,
"loss": 1.1453731060028076,
"memory(GiB)": 45.64,
"nll_loss": 0.7435779571533203,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.463644415140152,
"rewards/margins": 4.270198345184326,
"rewards/rejected": -4.733842849731445,
"step": 337,
"train_speed(iter/s)": 0.021152
},
{
"epoch": 0.6826558949760162,
"grad_norm": 12.933732986450195,
"learning_rate": 0.00015714451753481168,
"logits/chosen": -0.6461415886878967,
"logits/rejected": -0.9560658931732178,
"logps/chosen": -6.069940567016602,
"logps/rejected": -53.62686538696289,
"loss": 1.2495336532592773,
"memory(GiB)": 45.64,
"nll_loss": 0.8185646533966064,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.3106077015399933,
"rewards/margins": 3.0313639640808105,
"rewards/rejected": -3.3419713973999023,
"step": 338,
"train_speed(iter/s)": 0.021152
},
{
"epoch": 0.6846755869729866,
"grad_norm": 6.386441230773926,
"learning_rate": 0.00015686993109552443,
"logits/chosen": -0.9001967906951904,
"logits/rejected": -1.0288763046264648,
"logps/chosen": -4.8095598220825195,
"logps/rejected": -63.7664909362793,
"loss": 0.6220850348472595,
"memory(GiB)": 45.64,
"nll_loss": 0.42656922340393066,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.07018661499023438,
"rewards/margins": 4.841952323913574,
"rewards/rejected": -4.77176570892334,
"step": 339,
"train_speed(iter/s)": 0.021153
},
{
"epoch": 0.6866952789699571,
"grad_norm": 5.94568395614624,
"learning_rate": 0.00015659470943305955,
"logits/chosen": -0.8113903999328613,
"logits/rejected": -1.0205042362213135,
"logps/chosen": -3.7077159881591797,
"logps/rejected": -56.63233947753906,
"loss": 0.6539210081100464,
"memory(GiB)": 45.64,
"nll_loss": 0.4288255274295807,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.059340257197618484,
"rewards/margins": 4.157015800476074,
"rewards/rejected": -4.097675323486328,
"step": 340,
"train_speed(iter/s)": 0.021154
},
{
"epoch": 0.6887149709669276,
"grad_norm": 3.9790964126586914,
"learning_rate": 0.00015631885562157543,
"logits/chosen": -0.7372142672538757,
"logits/rejected": -0.9902328848838806,
"logps/chosen": -4.715322017669678,
"logps/rejected": -48.823387145996094,
"loss": 0.6435255408287048,
"memory(GiB)": 45.64,
"nll_loss": 0.3544943630695343,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.05755168944597244,
"rewards/margins": 2.823580741882324,
"rewards/rejected": -2.766029119491577,
"step": 341,
"train_speed(iter/s)": 0.021153
},
{
"epoch": 0.690734662963898,
"grad_norm": 3.6011016368865967,
"learning_rate": 0.00015604237274229147,
"logits/chosen": -0.9505451321601868,
"logits/rejected": -1.0710150003433228,
"logps/chosen": -1.6771836280822754,
"logps/rejected": -42.753135681152344,
"loss": 0.3884910047054291,
"memory(GiB)": 45.64,
"nll_loss": 0.2611246109008789,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41318997740745544,
"rewards/margins": 3.458676338195801,
"rewards/rejected": -3.0454862117767334,
"step": 342,
"train_speed(iter/s)": 0.021155
},
{
"epoch": 0.6927543549608685,
"grad_norm": 10.275211334228516,
"learning_rate": 0.00015576526388345367,
"logits/chosen": -0.9035798907279968,
"logits/rejected": -1.0091338157653809,
"logps/chosen": -4.990538597106934,
"logps/rejected": -41.765995025634766,
"loss": 0.998170018196106,
"memory(GiB)": 45.64,
"nll_loss": 0.7295805215835571,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13218021392822266,
"rewards/margins": 3.011774778366089,
"rewards/rejected": -2.879594326019287,
"step": 343,
"train_speed(iter/s)": 0.021155
},
{
"epoch": 0.694774046957839,
"grad_norm": 8.156365394592285,
"learning_rate": 0.0001554875321402999,
"logits/chosen": -0.8031080961227417,
"logits/rejected": -0.9648129940032959,
"logps/chosen": -2.28568696975708,
"logps/rejected": -35.34866714477539,
"loss": 0.5425023436546326,
"memory(GiB)": 45.64,
"nll_loss": 0.24677146971225739,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.23254749178886414,
"rewards/margins": 2.27335262298584,
"rewards/rejected": -2.0408051013946533,
"step": 344,
"train_speed(iter/s)": 0.021156
},
{
"epoch": 0.6967937389548093,
"grad_norm": 4.11509370803833,
"learning_rate": 0.00015520918061502569,
"logits/chosen": -0.8795959949493408,
"logits/rejected": -1.0246540307998657,
"logps/chosen": -1.0050594806671143,
"logps/rejected": -38.232444763183594,
"loss": 0.32429325580596924,
"memory(GiB)": 45.64,
"nll_loss": 0.1644802689552307,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3108518719673157,
"rewards/margins": 2.897658109664917,
"rewards/rejected": -2.586806297302246,
"step": 345,
"train_speed(iter/s)": 0.021157
},
{
"epoch": 0.6988134309517798,
"grad_norm": 3.702918529510498,
"learning_rate": 0.00015493021241674918,
"logits/chosen": -0.8280074000358582,
"logits/rejected": -0.9851573705673218,
"logps/chosen": -1.3124903440475464,
"logps/rejected": -35.455692291259766,
"loss": 0.46161431074142456,
"memory(GiB)": 45.64,
"nll_loss": 0.20427490770816803,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2279079556465149,
"rewards/margins": 2.2844018936157227,
"rewards/rejected": -2.0564939975738525,
"step": 346,
"train_speed(iter/s)": 0.021158
},
{
"epoch": 0.7008331229487503,
"grad_norm": 7.40757417678833,
"learning_rate": 0.0001546506306614768,
"logits/chosen": -0.8412176966667175,
"logits/rejected": -0.9579489231109619,
"logps/chosen": -6.378708839416504,
"logps/rejected": -44.914512634277344,
"loss": 0.6551076173782349,
"memory(GiB)": 45.64,
"nll_loss": 0.3504900634288788,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.00600462406873703,
"rewards/margins": 3.1142947673797607,
"rewards/rejected": -3.1202995777130127,
"step": 347,
"train_speed(iter/s)": 0.021159
},
{
"epoch": 0.7028528149457208,
"grad_norm": 2.9458255767822266,
"learning_rate": 0.0001543704384720681,
"logits/chosen": -0.7899777889251709,
"logits/rejected": -0.9945221543312073,
"logps/chosen": -1.4169785976409912,
"logps/rejected": -50.57292556762695,
"loss": 0.3628111779689789,
"memory(GiB)": 45.64,
"nll_loss": 0.15231113135814667,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.226759135723114,
"rewards/margins": 3.434785842895508,
"rewards/rejected": -3.208026647567749,
"step": 348,
"train_speed(iter/s)": 0.021159
},
{
"epoch": 0.7048725069426912,
"grad_norm": 4.447574615478516,
"learning_rate": 0.00015408963897820113,
"logits/chosen": -0.8848673105239868,
"logits/rejected": -0.8949815034866333,
"logps/chosen": -9.218939781188965,
"logps/rejected": -32.96113967895508,
"loss": 0.6976296901702881,
"memory(GiB)": 45.64,
"nll_loss": 0.31593263149261475,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1799672544002533,
"rewards/margins": 2.5064430236816406,
"rewards/rejected": -2.3264756202697754,
"step": 349,
"train_speed(iter/s)": 0.02116
},
{
"epoch": 0.7068921989396617,
"grad_norm": 3.5722556114196777,
"learning_rate": 0.00015380823531633729,
"logits/chosen": -0.9537544250488281,
"logits/rejected": -1.0240473747253418,
"logps/chosen": -3.9818813800811768,
"logps/rejected": -31.99053382873535,
"loss": 0.6191223859786987,
"memory(GiB)": 45.64,
"nll_loss": 0.34284406900405884,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09681667387485504,
"rewards/margins": 2.406569480895996,
"rewards/rejected": -2.309752941131592,
"step": 350,
"train_speed(iter/s)": 0.021161
},
{
"epoch": 0.7089118909366322,
"grad_norm": 3.7325596809387207,
"learning_rate": 0.00015352623062968648,
"logits/chosen": -0.922427773475647,
"logits/rejected": -0.9690065383911133,
"logps/chosen": -4.305528163909912,
"logps/rejected": -23.71919059753418,
"loss": 0.7693547010421753,
"memory(GiB)": 45.64,
"nll_loss": 0.33499932289123535,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.06479213386774063,
"rewards/margins": 1.370113730430603,
"rewards/rejected": -1.3053216934204102,
"step": 351,
"train_speed(iter/s)": 0.021139
},
{
"epoch": 0.7109315829336026,
"grad_norm": 16.7460880279541,
"learning_rate": 0.00015324362806817186,
"logits/chosen": -0.7807352542877197,
"logits/rejected": -0.9729360342025757,
"logps/chosen": -7.726840972900391,
"logps/rejected": -53.6373176574707,
"loss": 1.1061019897460938,
"memory(GiB)": 45.64,
"nll_loss": 0.6384282112121582,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.23256784677505493,
"rewards/margins": 2.8845200538635254,
"rewards/rejected": -3.1170878410339355,
"step": 352,
"train_speed(iter/s)": 0.021139
},
{
"epoch": 0.7129512749305731,
"grad_norm": 2.80759596824646,
"learning_rate": 0.00015296043078839473,
"logits/chosen": -0.7530017495155334,
"logits/rejected": -0.9337269067764282,
"logps/chosen": -1.4654000997543335,
"logps/rejected": -55.76970672607422,
"loss": 0.254292368888855,
"memory(GiB)": 45.64,
"nll_loss": 0.13821597397327423,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.28305867314338684,
"rewards/margins": 4.615407943725586,
"rewards/rejected": -4.3323493003845215,
"step": 353,
"train_speed(iter/s)": 0.02114
},
{
"epoch": 0.7149709669275436,
"grad_norm": 4.502577781677246,
"learning_rate": 0.00015267664195359917,
"logits/chosen": -0.9706122279167175,
"logits/rejected": -1.0545164346694946,
"logps/chosen": -1.6742087602615356,
"logps/rejected": -41.54838180541992,
"loss": 0.518170177936554,
"memory(GiB)": 45.64,
"nll_loss": 0.2445138841867447,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10661309212446213,
"rewards/margins": 3.0441462993621826,
"rewards/rejected": -2.937532901763916,
"step": 354,
"train_speed(iter/s)": 0.021141
},
{
"epoch": 0.716990658924514,
"grad_norm": 5.956605434417725,
"learning_rate": 0.00015239226473363687,
"logits/chosen": -0.9984610080718994,
"logits/rejected": -1.0658961534500122,
"logps/chosen": -2.667590379714966,
"logps/rejected": -30.01835823059082,
"loss": 0.6159235239028931,
"memory(GiB)": 45.64,
"nll_loss": 0.25425097346305847,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.13858197629451752,
"rewards/margins": 2.178638219833374,
"rewards/rejected": -2.0400562286376953,
"step": 355,
"train_speed(iter/s)": 0.021142
},
{
"epoch": 0.7190103509214845,
"grad_norm": 2.670485734939575,
"learning_rate": 0.00015210730230493162,
"logits/chosen": -0.8936488628387451,
"logits/rejected": -1.0093450546264648,
"logps/chosen": -3.5686304569244385,
"logps/rejected": -55.824180603027344,
"loss": 0.3414130210876465,
"memory(GiB)": 45.64,
"nll_loss": 0.20404773950576782,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14025713503360748,
"rewards/margins": 3.9673044681549072,
"rewards/rejected": -3.827047109603882,
"step": 356,
"train_speed(iter/s)": 0.021142
},
{
"epoch": 0.721030042918455,
"grad_norm": 4.567800521850586,
"learning_rate": 0.00015182175785044387,
"logits/chosen": -0.981977105140686,
"logits/rejected": -0.96744304895401,
"logps/chosen": -7.694738388061523,
"logps/rejected": -33.95967483520508,
"loss": 0.5043447613716125,
"memory(GiB)": 45.64,
"nll_loss": 0.24890656769275665,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2846420407295227,
"rewards/margins": 2.429332733154297,
"rewards/rejected": -2.144690752029419,
"step": 357,
"train_speed(iter/s)": 0.021143
},
{
"epoch": 0.7230497349154253,
"grad_norm": 8.642942428588867,
"learning_rate": 0.00015153563455963499,
"logits/chosen": -0.9537326097488403,
"logits/rejected": -1.1215823888778687,
"logps/chosen": -2.9258816242218018,
"logps/rejected": -48.52583312988281,
"loss": 0.7397590279579163,
"memory(GiB)": 45.64,
"nll_loss": 0.4563119411468506,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18413014709949493,
"rewards/margins": 4.132811069488525,
"rewards/rejected": -3.9486806392669678,
"step": 358,
"train_speed(iter/s)": 0.021144
},
{
"epoch": 0.7250694269123958,
"grad_norm": 24.88861083984375,
"learning_rate": 0.00015124893562843208,
"logits/chosen": -0.9031403660774231,
"logits/rejected": -0.9935811758041382,
"logps/chosen": -8.023815155029297,
"logps/rejected": -40.717247009277344,
"loss": 0.8925535082817078,
"memory(GiB)": 45.64,
"nll_loss": 0.5370101928710938,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3610239028930664,
"rewards/margins": 3.118933916091919,
"rewards/rejected": -2.7579100131988525,
"step": 359,
"train_speed(iter/s)": 0.021144
},
{
"epoch": 0.7270891189093663,
"grad_norm": 10.635350227355957,
"learning_rate": 0.00015096166425919175,
"logits/chosen": -0.9903375506401062,
"logits/rejected": -1.0812005996704102,
"logps/chosen": -3.357611656188965,
"logps/rejected": -47.11662292480469,
"loss": 0.7105602025985718,
"memory(GiB)": 45.64,
"nll_loss": 0.3658413290977478,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13873916864395142,
"rewards/margins": 3.40531063079834,
"rewards/rejected": -3.266571283340454,
"step": 360,
"train_speed(iter/s)": 0.021145
},
{
"epoch": 0.7291088109063368,
"grad_norm": 18.06879234313965,
"learning_rate": 0.0001506738236606648,
"logits/chosen": -1.099637508392334,
"logits/rejected": -1.1945291757583618,
"logps/chosen": -8.104093551635742,
"logps/rejected": -45.32279968261719,
"loss": 1.623255729675293,
"memory(GiB)": 45.64,
"nll_loss": 1.006649374961853,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.31839191913604736,
"rewards/margins": 3.014329433441162,
"rewards/rejected": -3.332721471786499,
"step": 361,
"train_speed(iter/s)": 0.021146
},
{
"epoch": 0.7311285029033072,
"grad_norm": 15.128271102905273,
"learning_rate": 0.00015038541704796003,
"logits/chosen": -1.1882942914962769,
"logits/rejected": -1.2618598937988281,
"logps/chosen": -1.8502236604690552,
"logps/rejected": -69.4446792602539,
"loss": 0.38569730520248413,
"memory(GiB)": 45.64,
"nll_loss": 0.24810141324996948,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.1845402717590332,
"rewards/margins": 6.129173278808594,
"rewards/rejected": -5.944633483886719,
"step": 362,
"train_speed(iter/s)": 0.021148
},
{
"epoch": 0.7331481949002777,
"grad_norm": 5.277956485748291,
"learning_rate": 0.00015009644764250863,
"logits/chosen": -1.163029432296753,
"logits/rejected": -1.2435169219970703,
"logps/chosen": -5.300413608551025,
"logps/rejected": -73.11473846435547,
"loss": 0.8010823130607605,
"memory(GiB)": 45.64,
"nll_loss": 0.5916219353675842,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.007427714765071869,
"rewards/margins": 5.836453914642334,
"rewards/rejected": -5.829026222229004,
"step": 363,
"train_speed(iter/s)": 0.021148
},
{
"epoch": 0.7351678868972482,
"grad_norm": 75.7375717163086,
"learning_rate": 0.0001498069186720279,
"logits/chosen": -1.1564539670944214,
"logits/rejected": -1.1993024349212646,
"logps/chosen": -2.832427978515625,
"logps/rejected": -73.21650695800781,
"loss": 0.8798462748527527,
"memory(GiB)": 45.64,
"nll_loss": 0.4809403121471405,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.17453742027282715,
"rewards/margins": 5.794814109802246,
"rewards/rejected": -5.620276927947998,
"step": 364,
"train_speed(iter/s)": 0.021149
},
{
"epoch": 0.7371875788942186,
"grad_norm": 2.991504669189453,
"learning_rate": 0.00014951683337048537,
"logits/chosen": -1.1292376518249512,
"logits/rejected": -1.1874810457229614,
"logps/chosen": -6.187487602233887,
"logps/rejected": -55.482765197753906,
"loss": 0.45134469866752625,
"memory(GiB)": 45.64,
"nll_loss": 0.22427882254123688,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3069310486316681,
"rewards/margins": 4.149868488311768,
"rewards/rejected": -3.842937707901001,
"step": 365,
"train_speed(iter/s)": 0.02115
},
{
"epoch": 0.7392072708911891,
"grad_norm": 10.73784065246582,
"learning_rate": 0.00014922619497806277,
"logits/chosen": -1.167018175125122,
"logits/rejected": -1.2153444290161133,
"logps/chosen": -1.954573631286621,
"logps/rejected": -61.2001953125,
"loss": 0.5314586162567139,
"memory(GiB)": 45.64,
"nll_loss": 0.2992059588432312,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14029161632061005,
"rewards/margins": 4.6798810958862305,
"rewards/rejected": -4.539588928222656,
"step": 366,
"train_speed(iter/s)": 0.02115
},
{
"epoch": 0.7412269628881596,
"grad_norm": 5.413460731506348,
"learning_rate": 0.0001489350067411196,
"logits/chosen": -1.1709797382354736,
"logits/rejected": -1.1748571395874023,
"logps/chosen": -7.91160774230957,
"logps/rejected": -46.791404724121094,
"loss": 0.5436979532241821,
"memory(GiB)": 45.64,
"nll_loss": 0.30416107177734375,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3512665033340454,
"rewards/margins": 3.6528432369232178,
"rewards/rejected": -3.301577091217041,
"step": 367,
"train_speed(iter/s)": 0.021151
},
{
"epoch": 0.74324665488513,
"grad_norm": 7.643467903137207,
"learning_rate": 0.00014864327191215702,
"logits/chosen": -1.1821328401565552,
"logits/rejected": -1.2253855466842651,
"logps/chosen": -2.3498167991638184,
"logps/rejected": -73.46287536621094,
"loss": 0.664942741394043,
"memory(GiB)": 45.64,
"nll_loss": 0.454881489276886,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1444016695022583,
"rewards/margins": 5.324404716491699,
"rewards/rejected": -5.1800031661987305,
"step": 368,
"train_speed(iter/s)": 0.021151
},
{
"epoch": 0.7452663468821005,
"grad_norm": 3.926517963409424,
"learning_rate": 0.00014835099374978147,
"logits/chosen": -1.1555640697479248,
"logits/rejected": -1.2078311443328857,
"logps/chosen": -0.9639624953269958,
"logps/rejected": -67.16943359375,
"loss": 0.2394624501466751,
"memory(GiB)": 45.64,
"nll_loss": 0.1322186291217804,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2654881775379181,
"rewards/margins": 6.110224723815918,
"rewards/rejected": -5.844736099243164,
"step": 369,
"train_speed(iter/s)": 0.021152
},
{
"epoch": 0.747286038879071,
"grad_norm": 4.563858985900879,
"learning_rate": 0.00014805817551866838,
"logits/chosen": -1.183912992477417,
"logits/rejected": -1.2156834602355957,
"logps/chosen": -1.4219800233840942,
"logps/rejected": -39.744171142578125,
"loss": 0.3572657108306885,
"memory(GiB)": 45.64,
"nll_loss": 0.15966495871543884,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4396134316921234,
"rewards/margins": 3.298137903213501,
"rewards/rejected": -2.8585243225097656,
"step": 370,
"train_speed(iter/s)": 0.021153
},
{
"epoch": 0.7493057308760414,
"grad_norm": 4.50530481338501,
"learning_rate": 0.00014776482048952551,
"logits/chosen": -1.1194803714752197,
"logits/rejected": -1.1540480852127075,
"logps/chosen": -1.7459050416946411,
"logps/rejected": -64.54890441894531,
"loss": 0.2934742867946625,
"memory(GiB)": 45.64,
"nll_loss": 0.15494152903556824,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2886925935745239,
"rewards/margins": 5.029353141784668,
"rewards/rejected": -4.740660190582275,
"step": 371,
"train_speed(iter/s)": 0.021153
},
{
"epoch": 0.7513254228730119,
"grad_norm": 7.041140556335449,
"learning_rate": 0.00014747093193905657,
"logits/chosen": -1.1590553522109985,
"logits/rejected": -1.1508252620697021,
"logps/chosen": -3.047581434249878,
"logps/rejected": -61.70812225341797,
"loss": 0.6074828505516052,
"memory(GiB)": 45.64,
"nll_loss": 0.3978445827960968,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13817714154720306,
"rewards/margins": 4.407755374908447,
"rewards/rejected": -4.269577980041504,
"step": 372,
"train_speed(iter/s)": 0.021154
},
{
"epoch": 0.7533451148699823,
"grad_norm": 4.780473709106445,
"learning_rate": 0.00014717651314992455,
"logits/chosen": -1.1245406866073608,
"logits/rejected": -1.1541649103164673,
"logps/chosen": -2.052983283996582,
"logps/rejected": -59.029022216796875,
"loss": 0.3612958490848541,
"memory(GiB)": 45.64,
"nll_loss": 0.17177711427211761,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1790371835231781,
"rewards/margins": 4.619558811187744,
"rewards/rejected": -4.440521717071533,
"step": 373,
"train_speed(iter/s)": 0.021154
},
{
"epoch": 0.7553648068669528,
"grad_norm": 2.6618669033050537,
"learning_rate": 0.00014688156741071514,
"logits/chosen": -1.16391921043396,
"logits/rejected": -1.2101376056671143,
"logps/chosen": -2.5643341541290283,
"logps/rejected": -50.99317932128906,
"loss": 0.359174907207489,
"memory(GiB)": 45.64,
"nll_loss": 0.14501263201236725,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2054893523454666,
"rewards/margins": 4.245234489440918,
"rewards/rejected": -4.039744853973389,
"step": 374,
"train_speed(iter/s)": 0.021155
},
{
"epoch": 0.7573844988639232,
"grad_norm": 2.183286666870117,
"learning_rate": 0.00014658609801589982,
"logits/chosen": -1.197989583015442,
"logits/rejected": -1.232681155204773,
"logps/chosen": -1.0838813781738281,
"logps/rejected": -53.68153762817383,
"loss": 0.27284619212150574,
"memory(GiB)": 45.64,
"nll_loss": 0.11144410073757172,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3119613528251648,
"rewards/margins": 4.7982072830200195,
"rewards/rejected": -4.486246109008789,
"step": 375,
"train_speed(iter/s)": 0.021156
},
{
"epoch": 0.7594041908608937,
"grad_norm": 6.413065433502197,
"learning_rate": 0.00014629010826579928,
"logits/chosen": -1.217897891998291,
"logits/rejected": -1.279034972190857,
"logps/chosen": -2.029020071029663,
"logps/rejected": -67.19940948486328,
"loss": 0.3730330765247345,
"memory(GiB)": 45.64,
"nll_loss": 0.2322002500295639,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2920472323894501,
"rewards/margins": 5.175812244415283,
"rewards/rejected": -4.883764266967773,
"step": 376,
"train_speed(iter/s)": 0.021157
},
{
"epoch": 0.7614238828578642,
"grad_norm": 3.451570987701416,
"learning_rate": 0.0001459936014665464,
"logits/chosen": -1.17360258102417,
"logits/rejected": -1.2139333486557007,
"logps/chosen": -4.350042819976807,
"logps/rejected": -56.49632263183594,
"loss": 0.5775706171989441,
"memory(GiB)": 45.64,
"nll_loss": 0.39697498083114624,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23329809308052063,
"rewards/margins": 4.431912422180176,
"rewards/rejected": -4.198614597320557,
"step": 377,
"train_speed(iter/s)": 0.021158
},
{
"epoch": 0.7634435748548346,
"grad_norm": 5.291248798370361,
"learning_rate": 0.00014569658093004935,
"logits/chosen": -1.1762566566467285,
"logits/rejected": -1.2233586311340332,
"logps/chosen": -3.534919261932373,
"logps/rejected": -80.47354888916016,
"loss": 0.30777013301849365,
"memory(GiB)": 45.64,
"nll_loss": 0.2154829502105713,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2291412353515625,
"rewards/margins": 6.180717468261719,
"rewards/rejected": -5.951576232910156,
"step": 378,
"train_speed(iter/s)": 0.021158
},
{
"epoch": 0.7654632668518051,
"grad_norm": 10.057852745056152,
"learning_rate": 0.00014539904997395468,
"logits/chosen": -1.1968324184417725,
"logits/rejected": -1.2274653911590576,
"logps/chosen": -3.546328544616699,
"logps/rejected": -69.02865600585938,
"loss": 0.6399840712547302,
"memory(GiB)": 45.64,
"nll_loss": 0.4272352159023285,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11763279885053635,
"rewards/margins": 5.601714611053467,
"rewards/rejected": -5.484081745147705,
"step": 379,
"train_speed(iter/s)": 0.021158
},
{
"epoch": 0.7674829588487756,
"grad_norm": 4.334756374359131,
"learning_rate": 0.00014510101192161018,
"logits/chosen": -1.2146495580673218,
"logits/rejected": -1.2545320987701416,
"logps/chosen": -6.085969924926758,
"logps/rejected": -41.06128692626953,
"loss": 0.776848316192627,
"memory(GiB)": 45.64,
"nll_loss": 0.5693851709365845,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.19634687900543213,
"rewards/margins": 3.313415050506592,
"rewards/rejected": -3.1170685291290283,
"step": 380,
"train_speed(iter/s)": 0.021159
},
{
"epoch": 0.769502650845746,
"grad_norm": 6.6673479080200195,
"learning_rate": 0.00014480247010202775,
"logits/chosen": -1.2620035409927368,
"logits/rejected": -1.2927439212799072,
"logps/chosen": -0.9638640880584717,
"logps/rejected": -58.5118293762207,
"loss": 0.3140888810157776,
"memory(GiB)": 45.64,
"nll_loss": 0.13222388923168182,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.43909886479377747,
"rewards/margins": 5.030383110046387,
"rewards/rejected": -4.591284275054932,
"step": 381,
"train_speed(iter/s)": 0.02116
},
{
"epoch": 0.7715223428427165,
"grad_norm": 1.8640215396881104,
"learning_rate": 0.00014450342784984633,
"logits/chosen": -1.2142149209976196,
"logits/rejected": -1.2449159622192383,
"logps/chosen": -3.2471883296966553,
"logps/rejected": -69.44312286376953,
"loss": 0.2647269666194916,
"memory(GiB)": 45.64,
"nll_loss": 0.17502562701702118,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.32493484020233154,
"rewards/margins": 5.946244239807129,
"rewards/rejected": -5.621310234069824,
"step": 382,
"train_speed(iter/s)": 0.02116
},
{
"epoch": 0.773542034839687,
"grad_norm": 4.235260963439941,
"learning_rate": 0.00014420388850529446,
"logits/chosen": -1.2407033443450928,
"logits/rejected": -1.280212163925171,
"logps/chosen": -1.4121766090393066,
"logps/rejected": -73.05975341796875,
"loss": 0.4667883813381195,
"memory(GiB)": 45.64,
"nll_loss": 0.23148246109485626,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.42525410652160645,
"rewards/margins": 5.927689552307129,
"rewards/rejected": -5.502435207366943,
"step": 383,
"train_speed(iter/s)": 0.021161
},
{
"epoch": 0.7755617268366574,
"grad_norm": 11.74973201751709,
"learning_rate": 0.00014390385541415308,
"logits/chosen": -1.2475506067276,
"logits/rejected": -1.2707443237304688,
"logps/chosen": -2.454108953475952,
"logps/rejected": -42.124366760253906,
"loss": 0.6018331050872803,
"memory(GiB)": 45.64,
"nll_loss": 0.3722446858882904,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23790600895881653,
"rewards/margins": 3.314408779144287,
"rewards/rejected": -3.076502561569214,
"step": 384,
"train_speed(iter/s)": 0.021162
},
{
"epoch": 0.7775814188336279,
"grad_norm": 2.7534830570220947,
"learning_rate": 0.0001436033319277183,
"logits/chosen": -1.2355518341064453,
"logits/rejected": -1.2741280794143677,
"logps/chosen": -0.7196122407913208,
"logps/rejected": -107.31944274902344,
"loss": 0.1968921422958374,
"memory(GiB)": 45.64,
"nll_loss": 0.1137460246682167,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2591235637664795,
"rewards/margins": 8.63725757598877,
"rewards/rejected": -8.378134727478027,
"step": 385,
"train_speed(iter/s)": 0.021162
},
{
"epoch": 0.7796011108305984,
"grad_norm": 5.864130020141602,
"learning_rate": 0.00014330232140276366,
"logits/chosen": -1.1965060234069824,
"logits/rejected": -1.2489956617355347,
"logps/chosen": -3.9303858280181885,
"logps/rejected": -66.87359619140625,
"loss": 0.6629573106765747,
"memory(GiB)": 45.64,
"nll_loss": 0.5041288137435913,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20213821530342102,
"rewards/margins": 5.429197311401367,
"rewards/rejected": -5.2270588874816895,
"step": 386,
"train_speed(iter/s)": 0.021162
},
{
"epoch": 0.7816208028275689,
"grad_norm": 0.9686940312385559,
"learning_rate": 0.0001430008272015029,
"logits/chosen": -1.168556571006775,
"logits/rejected": -1.2702208757400513,
"logps/chosen": -0.1927298754453659,
"logps/rejected": -86.75350189208984,
"loss": 0.07656482607126236,
"memory(GiB)": 45.64,
"nll_loss": 0.02479482628405094,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3893800973892212,
"rewards/margins": 6.8833112716674805,
"rewards/rejected": -6.493931770324707,
"step": 387,
"train_speed(iter/s)": 0.021162
},
{
"epoch": 0.7836404948245392,
"grad_norm": 6.69142484664917,
"learning_rate": 0.0001426988526915523,
"logits/chosen": -1.1132441759109497,
"logits/rejected": -1.2206928730010986,
"logps/chosen": -2.1822941303253174,
"logps/rejected": -58.27075958251953,
"loss": 0.4767617881298065,
"memory(GiB)": 45.64,
"nll_loss": 0.2635282874107361,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.18697461485862732,
"rewards/margins": 4.062845706939697,
"rewards/rejected": -3.875871419906616,
"step": 388,
"train_speed(iter/s)": 0.021163
},
{
"epoch": 0.7856601868215097,
"grad_norm": 22.11477279663086,
"learning_rate": 0.00014239640124589302,
"logits/chosen": -1.1612333059310913,
"logits/rejected": -1.2209270000457764,
"logps/chosen": -5.149811267852783,
"logps/rejected": -56.67973327636719,
"loss": 0.9844444394111633,
"memory(GiB)": 45.64,
"nll_loss": 0.464616984128952,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.07719806581735611,
"rewards/margins": 3.927542209625244,
"rewards/rejected": -4.004740238189697,
"step": 389,
"train_speed(iter/s)": 0.021163
},
{
"epoch": 0.7876798788184802,
"grad_norm": 4.598104476928711,
"learning_rate": 0.0001420934762428335,
"logits/chosen": -1.191237211227417,
"logits/rejected": -1.2505682706832886,
"logps/chosen": -1.6766197681427002,
"logps/rejected": -68.58138275146484,
"loss": 0.37751591205596924,
"memory(GiB)": 45.64,
"nll_loss": 0.1912289708852768,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2715514898300171,
"rewards/margins": 6.051302909851074,
"rewards/rejected": -5.779752731323242,
"step": 390,
"train_speed(iter/s)": 0.021164
},
{
"epoch": 0.7896995708154506,
"grad_norm": 5.1656084060668945,
"learning_rate": 0.00014179008106597173,
"logits/chosen": -1.1447128057479858,
"logits/rejected": -1.2311046123504639,
"logps/chosen": -1.3589807748794556,
"logps/rejected": -69.0888900756836,
"loss": 0.37555360794067383,
"memory(GiB)": 45.64,
"nll_loss": 0.20962855219841003,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2835935950279236,
"rewards/margins": 6.014133453369141,
"rewards/rejected": -5.730539798736572,
"step": 391,
"train_speed(iter/s)": 0.021165
},
{
"epoch": 0.7917192628124211,
"grad_norm": 4.515217304229736,
"learning_rate": 0.0001414862191041574,
"logits/chosen": -1.1313319206237793,
"logits/rejected": -1.1735104322433472,
"logps/chosen": -1.4379080533981323,
"logps/rejected": -41.75006103515625,
"loss": 0.42747819423675537,
"memory(GiB)": 45.64,
"nll_loss": 0.13288989663124084,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.21147757768630981,
"rewards/margins": 3.0256876945495605,
"rewards/rejected": -2.8142104148864746,
"step": 392,
"train_speed(iter/s)": 0.021166
},
{
"epoch": 0.7937389548093916,
"grad_norm": 4.281467437744141,
"learning_rate": 0.00014118189375145402,
"logits/chosen": -1.129544734954834,
"logits/rejected": -1.2433701753616333,
"logps/chosen": -1.0194271802902222,
"logps/rejected": -68.8100357055664,
"loss": 0.4009433388710022,
"memory(GiB)": 45.64,
"nll_loss": 0.2110380381345749,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.42351850867271423,
"rewards/margins": 5.658205032348633,
"rewards/rejected": -5.234686374664307,
"step": 393,
"train_speed(iter/s)": 0.021166
},
{
"epoch": 0.795758646806362,
"grad_norm": 0.9730565547943115,
"learning_rate": 0.0001408771084071012,
"logits/chosen": -1.098219394683838,
"logits/rejected": -1.2555054426193237,
"logps/chosen": -0.3178718388080597,
"logps/rejected": -82.52906799316406,
"loss": 0.08471984416246414,
"memory(GiB)": 45.64,
"nll_loss": 0.025890445336699486,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41851806640625,
"rewards/margins": 7.259293556213379,
"rewards/rejected": -6.840775489807129,
"step": 394,
"train_speed(iter/s)": 0.021167
},
{
"epoch": 0.7977783388033325,
"grad_norm": 6.422388076782227,
"learning_rate": 0.0001405718664754764,
"logits/chosen": -1.0757089853286743,
"logits/rejected": -1.2194029092788696,
"logps/chosen": -4.098117351531982,
"logps/rejected": -79.46504211425781,
"loss": 0.9334844946861267,
"memory(GiB)": 45.64,
"nll_loss": 0.670303463935852,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.09435828030109406,
"rewards/margins": 6.080230236053467,
"rewards/rejected": -6.174588680267334,
"step": 395,
"train_speed(iter/s)": 0.021168
},
{
"epoch": 0.799798030800303,
"grad_norm": 3.1609609127044678,
"learning_rate": 0.0001402661713660571,
"logits/chosen": -1.1343252658843994,
"logits/rejected": -1.2600665092468262,
"logps/chosen": -1.6706289052963257,
"logps/rejected": -69.32755279541016,
"loss": 0.22293509542942047,
"memory(GiB)": 45.64,
"nll_loss": 0.17708872258663177,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.18604204058647156,
"rewards/margins": 6.022045612335205,
"rewards/rejected": -5.836003303527832,
"step": 396,
"train_speed(iter/s)": 0.021169
},
{
"epoch": 0.8018177227972734,
"grad_norm": 3.5824060440063477,
"learning_rate": 0.0001399600264933827,
"logits/chosen": -1.1588817834854126,
"logits/rejected": -1.2686594724655151,
"logps/chosen": -2.480526924133301,
"logps/rejected": -77.53683471679688,
"loss": 0.400388240814209,
"memory(GiB)": 45.64,
"nll_loss": 0.2272554636001587,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2708975374698639,
"rewards/margins": 6.85975980758667,
"rewards/rejected": -6.58886194229126,
"step": 397,
"train_speed(iter/s)": 0.021169
},
{
"epoch": 0.8038374147942439,
"grad_norm": 8.915884017944336,
"learning_rate": 0.00013965343527701628,
"logits/chosen": -1.0931580066680908,
"logits/rejected": -1.2515380382537842,
"logps/chosen": -6.809703826904297,
"logps/rejected": -92.00086975097656,
"loss": 1.2307904958724976,
"memory(GiB)": 45.64,
"nll_loss": 0.950491189956665,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.23660066723823547,
"rewards/margins": 7.736156463623047,
"rewards/rejected": -7.9727559089660645,
"step": 398,
"train_speed(iter/s)": 0.02117
},
{
"epoch": 0.8058571067912144,
"grad_norm": 16.942861557006836,
"learning_rate": 0.00013934640114150656,
"logits/chosen": -1.1165294647216797,
"logits/rejected": -1.2258877754211426,
"logps/chosen": -5.151846885681152,
"logps/rejected": -50.20682144165039,
"loss": 1.4095838069915771,
"memory(GiB)": 45.64,
"nll_loss": 1.0055750608444214,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.08993971347808838,
"rewards/margins": 3.8719429969787598,
"rewards/rejected": -3.9618825912475586,
"step": 399,
"train_speed(iter/s)": 0.021171
},
{
"epoch": 0.8078767987881847,
"grad_norm": 12.716894149780273,
"learning_rate": 0.00013903892751634947,
"logits/chosen": -1.1147105693817139,
"logits/rejected": -1.2179588079452515,
"logps/chosen": -2.3593387603759766,
"logps/rejected": -60.22994613647461,
"loss": 0.3005334734916687,
"memory(GiB)": 45.64,
"nll_loss": 0.17930257320404053,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2562834620475769,
"rewards/margins": 5.470202445983887,
"rewards/rejected": -5.213918685913086,
"step": 400,
"train_speed(iter/s)": 0.021172
},
{
"epoch": 0.8098964907851552,
"grad_norm": 3.6407527923583984,
"learning_rate": 0.00013873101783594999,
"logits/chosen": -0.9179055690765381,
"logits/rejected": -1.0948255062103271,
"logps/chosen": -7.396864414215088,
"logps/rejected": -76.39356994628906,
"loss": 0.7279776334762573,
"memory(GiB)": 45.64,
"nll_loss": 0.5141282081604004,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07542237639427185,
"rewards/margins": 5.8221588134765625,
"rewards/rejected": -5.746736526489258,
"step": 401,
"train_speed(iter/s)": 0.021153
},
{
"epoch": 0.8119161827821257,
"grad_norm": 4.730077743530273,
"learning_rate": 0.00013842267553958371,
"logits/chosen": -1.0015758275985718,
"logits/rejected": -1.173001766204834,
"logps/chosen": -1.2833012342453003,
"logps/rejected": -65.50496673583984,
"loss": 0.31842923164367676,
"memory(GiB)": 45.64,
"nll_loss": 0.15187285840511322,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3435157239437103,
"rewards/margins": 5.360050201416016,
"rewards/rejected": -5.016533851623535,
"step": 402,
"train_speed(iter/s)": 0.021154
},
{
"epoch": 0.8139358747790962,
"grad_norm": 6.681663513183594,
"learning_rate": 0.00013811390407135837,
"logits/chosen": -1.0345579385757446,
"logits/rejected": -1.1669750213623047,
"logps/chosen": -2.711009979248047,
"logps/rejected": -48.982208251953125,
"loss": 0.49727287888526917,
"memory(GiB)": 45.64,
"nll_loss": 0.25284403562545776,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15987528860569,
"rewards/margins": 4.172056674957275,
"rewards/rejected": -4.012181282043457,
"step": 403,
"train_speed(iter/s)": 0.021155
},
{
"epoch": 0.8159555667760666,
"grad_norm": 3.184199571609497,
"learning_rate": 0.00013780470688017562,
"logits/chosen": -1.0638835430145264,
"logits/rejected": -1.1304998397827148,
"logps/chosen": -4.9558868408203125,
"logps/rejected": -44.02895736694336,
"loss": 0.6054225564002991,
"memory(GiB)": 45.64,
"nll_loss": 0.3829798102378845,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39171290397644043,
"rewards/margins": 3.7432100772857666,
"rewards/rejected": -3.3514974117279053,
"step": 404,
"train_speed(iter/s)": 0.021156
},
{
"epoch": 0.8179752587730371,
"grad_norm": 16.700468063354492,
"learning_rate": 0.00013749508741969213,
"logits/chosen": -0.9126327633857727,
"logits/rejected": -0.9981098771095276,
"logps/chosen": -8.324628829956055,
"logps/rejected": -54.67494201660156,
"loss": 1.088732361793518,
"memory(GiB)": 45.64,
"nll_loss": 0.7484469413757324,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.14237897098064423,
"rewards/margins": 3.1626644134521484,
"rewards/rejected": -3.3050432205200195,
"step": 405,
"train_speed(iter/s)": 0.021156
},
{
"epoch": 0.8199949507700076,
"grad_norm": 4.572319507598877,
"learning_rate": 0.00013718504914828135,
"logits/chosen": -0.9639456272125244,
"logits/rejected": -1.0909277200698853,
"logps/chosen": -2.374218225479126,
"logps/rejected": -28.60363006591797,
"loss": 0.6309629082679749,
"memory(GiB)": 45.64,
"nll_loss": 0.3386070728302002,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.38088110089302063,
"rewards/margins": 2.043933868408203,
"rewards/rejected": -1.6630527973175049,
"step": 406,
"train_speed(iter/s)": 0.021157
},
{
"epoch": 0.822014642766978,
"grad_norm": 7.175300598144531,
"learning_rate": 0.00013687459552899465,
"logits/chosen": -1.011370062828064,
"logits/rejected": -1.1552919149398804,
"logps/chosen": -0.751252293586731,
"logps/rejected": -58.353179931640625,
"loss": 0.3189142942428589,
"memory(GiB)": 45.64,
"nll_loss": 0.1253315508365631,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2173149585723877,
"rewards/margins": 4.045991897583008,
"rewards/rejected": -3.828676700592041,
"step": 407,
"train_speed(iter/s)": 0.021157
},
{
"epoch": 0.8240343347639485,
"grad_norm": 3.638871908187866,
"learning_rate": 0.0001365637300295229,
"logits/chosen": -0.9884570240974426,
"logits/rejected": -1.1229445934295654,
"logps/chosen": -2.4416940212249756,
"logps/rejected": -49.12045669555664,
"loss": 0.5083186030387878,
"memory(GiB)": 45.64,
"nll_loss": 0.30594146251678467,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28965339064598083,
"rewards/margins": 3.306330919265747,
"rewards/rejected": -3.0166776180267334,
"step": 408,
"train_speed(iter/s)": 0.021158
},
{
"epoch": 0.826054026760919,
"grad_norm": 1.9313740730285645,
"learning_rate": 0.0001362524561221574,
"logits/chosen": -1.0589873790740967,
"logits/rejected": -1.155687928199768,
"logps/chosen": -0.7494394183158875,
"logps/rejected": -61.899314880371094,
"loss": 0.16012489795684814,
"memory(GiB)": 45.64,
"nll_loss": 0.06837154924869537,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.422152578830719,
"rewards/margins": 5.1323323249816895,
"rewards/rejected": -4.710179805755615,
"step": 409,
"train_speed(iter/s)": 0.021159
},
{
"epoch": 0.8280737187578894,
"grad_norm": 2.8826475143432617,
"learning_rate": 0.00013594077728375128,
"logits/chosen": -1.046625018119812,
"logits/rejected": -1.1403248310089111,
"logps/chosen": -2.6342790126800537,
"logps/rejected": -47.86298370361328,
"loss": 0.3936201333999634,
"memory(GiB)": 45.64,
"nll_loss": 0.19051307439804077,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13923531770706177,
"rewards/margins": 3.3216652870178223,
"rewards/rejected": -3.182429790496826,
"step": 410,
"train_speed(iter/s)": 0.02116
},
{
"epoch": 0.8300934107548599,
"grad_norm": 7.247873306274414,
"learning_rate": 0.00013562869699568076,
"logits/chosen": -1.1259405612945557,
"logits/rejected": -1.1454825401306152,
"logps/chosen": -7.434700012207031,
"logps/rejected": -49.61088562011719,
"loss": 0.960975170135498,
"memory(GiB)": 45.64,
"nll_loss": 0.7216768860816956,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.03636153042316437,
"rewards/margins": 3.5744729042053223,
"rewards/rejected": -3.6108345985412598,
"step": 411,
"train_speed(iter/s)": 0.02116
},
{
"epoch": 0.8321131027518304,
"grad_norm": 2.7764785289764404,
"learning_rate": 0.00013531621874380613,
"logits/chosen": -0.9636606574058533,
"logits/rejected": -1.1189731359481812,
"logps/chosen": -3.8168373107910156,
"logps/rejected": -65.32124328613281,
"loss": 0.31505468487739563,
"memory(GiB)": 45.64,
"nll_loss": 0.2553892135620117,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2123510092496872,
"rewards/margins": 5.209415912628174,
"rewards/rejected": -4.997064590454102,
"step": 412,
"train_speed(iter/s)": 0.02116
},
{
"epoch": 0.8341327947488008,
"grad_norm": 4.009552001953125,
"learning_rate": 0.0001350033460184327,
"logits/chosen": -0.8576051592826843,
"logits/rejected": -1.1664515733718872,
"logps/chosen": -1.3953887224197388,
"logps/rejected": -94.75813293457031,
"loss": 0.1995779424905777,
"memory(GiB)": 45.64,
"nll_loss": 0.09238594025373459,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.33278360962867737,
"rewards/margins": 6.894500255584717,
"rewards/rejected": -6.5617170333862305,
"step": 413,
"train_speed(iter/s)": 0.02116
},
{
"epoch": 0.8361524867457713,
"grad_norm": 14.014391899108887,
"learning_rate": 0.00013469008231427207,
"logits/chosen": -1.1141268014907837,
"logits/rejected": -1.1793636083602905,
"logps/chosen": -2.8426718711853027,
"logps/rejected": -64.9253158569336,
"loss": 0.6592072248458862,
"memory(GiB)": 45.64,
"nll_loss": 0.44861316680908203,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20249105989933014,
"rewards/margins": 5.202639579772949,
"rewards/rejected": -5.000148296356201,
"step": 414,
"train_speed(iter/s)": 0.02116
},
{
"epoch": 0.8381721787427417,
"grad_norm": 6.667239189147949,
"learning_rate": 0.00013437643113040301,
"logits/chosen": -1.1405432224273682,
"logits/rejected": -1.205533504486084,
"logps/chosen": -4.049654960632324,
"logps/rejected": -65.5449447631836,
"loss": 0.955814003944397,
"memory(GiB)": 45.64,
"nll_loss": 0.7577894926071167,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.011894673109054565,
"rewards/margins": 5.261639595031738,
"rewards/rejected": -5.273534297943115,
"step": 415,
"train_speed(iter/s)": 0.021161
},
{
"epoch": 0.8401918707397122,
"grad_norm": 5.3052802085876465,
"learning_rate": 0.00013406239597023225,
"logits/chosen": -1.1984199285507202,
"logits/rejected": -1.2300504446029663,
"logps/chosen": -2.0026376247406006,
"logps/rejected": -44.80060958862305,
"loss": 0.32053616642951965,
"memory(GiB)": 45.64,
"nll_loss": 0.1967550367116928,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.29741793870925903,
"rewards/margins": 3.937462329864502,
"rewards/rejected": -3.6400444507598877,
"step": 416,
"train_speed(iter/s)": 0.021162
},
{
"epoch": 0.8422115627366826,
"grad_norm": 4.6360578536987305,
"learning_rate": 0.0001337479803414555,
"logits/chosen": -1.1135053634643555,
"logits/rejected": -1.1990042924880981,
"logps/chosen": -1.2526822090148926,
"logps/rejected": -64.39313507080078,
"loss": 0.3324093520641327,
"memory(GiB)": 45.64,
"nll_loss": 0.19946074485778809,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22650685906410217,
"rewards/margins": 5.059194087982178,
"rewards/rejected": -4.8326873779296875,
"step": 417,
"train_speed(iter/s)": 0.021162
},
{
"epoch": 0.8442312547336531,
"grad_norm": 5.64458703994751,
"learning_rate": 0.0001334331877560182,
"logits/chosen": -1.1316285133361816,
"logits/rejected": -1.1844420433044434,
"logps/chosen": -2.270009994506836,
"logps/rejected": -73.60192108154297,
"loss": 0.37290775775909424,
"memory(GiB)": 45.64,
"nll_loss": 0.2037116289138794,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22195757925510406,
"rewards/margins": 6.114259719848633,
"rewards/rejected": -5.892301559448242,
"step": 418,
"train_speed(iter/s)": 0.021163
},
{
"epoch": 0.8462509467306236,
"grad_norm": 1.5520920753479004,
"learning_rate": 0.00013311802173007626,
"logits/chosen": -1.1409199237823486,
"logits/rejected": -1.203282356262207,
"logps/chosen": -2.087766408920288,
"logps/rejected": -75.88261413574219,
"loss": 0.19689969718456268,
"memory(GiB)": 45.64,
"nll_loss": 0.11977825313806534,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1527182012796402,
"rewards/margins": 6.459143161773682,
"rewards/rejected": -6.306424617767334,
"step": 419,
"train_speed(iter/s)": 0.021164
},
{
"epoch": 0.848270638727594,
"grad_norm": 16.449495315551758,
"learning_rate": 0.0001328024857839569,
"logits/chosen": -1.189044713973999,
"logits/rejected": -1.2236502170562744,
"logps/chosen": -4.713018894195557,
"logps/rejected": -54.21986389160156,
"loss": 0.7003884315490723,
"memory(GiB)": 45.64,
"nll_loss": 0.4415695369243622,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.018294498324394226,
"rewards/margins": 4.57138204574585,
"rewards/rejected": -4.589676856994629,
"step": 420,
"train_speed(iter/s)": 0.021164
},
{
"epoch": 0.8502903307245645,
"grad_norm": 28.160564422607422,
"learning_rate": 0.00013248658344211926,
"logits/chosen": -1.0967679023742676,
"logits/rejected": -1.1361645460128784,
"logps/chosen": -6.815154552459717,
"logps/rejected": -83.51364135742188,
"loss": 1.2551347017288208,
"memory(GiB)": 45.64,
"nll_loss": 0.8729581832885742,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.03463226556777954,
"rewards/margins": 6.367086410522461,
"rewards/rejected": -6.401719093322754,
"step": 421,
"train_speed(iter/s)": 0.021164
},
{
"epoch": 0.852310022721535,
"grad_norm": 31.47573471069336,
"learning_rate": 0.00013217031823311488,
"logits/chosen": -1.1553871631622314,
"logits/rejected": -1.2064706087112427,
"logps/chosen": -5.438415050506592,
"logps/rejected": -65.18042755126953,
"loss": 0.8344112038612366,
"memory(GiB)": 45.64,
"nll_loss": 0.5628060698509216,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07962656021118164,
"rewards/margins": 5.513628959655762,
"rewards/rejected": -5.434001922607422,
"step": 422,
"train_speed(iter/s)": 0.021165
},
{
"epoch": 0.8543297147185054,
"grad_norm": 8.784391403198242,
"learning_rate": 0.0001318536936895487,
"logits/chosen": -1.123747706413269,
"logits/rejected": -1.1673023700714111,
"logps/chosen": -3.4688830375671387,
"logps/rejected": -54.17964172363281,
"loss": 0.8599854707717896,
"memory(GiB)": 45.64,
"nll_loss": 0.5710347890853882,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.038751691579818726,
"rewards/margins": 4.241340637207031,
"rewards/rejected": -4.2025885581970215,
"step": 423,
"train_speed(iter/s)": 0.021166
},
{
"epoch": 0.8563494067154759,
"grad_norm": 22.89176368713379,
"learning_rate": 0.00013153671334803905,
"logits/chosen": -1.1089229583740234,
"logits/rejected": -1.1420047283172607,
"logps/chosen": -4.063858985900879,
"logps/rejected": -40.476722717285156,
"loss": 0.9364627599716187,
"memory(GiB)": 45.64,
"nll_loss": 0.6597320437431335,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.02382955513894558,
"rewards/margins": 3.0120341777801514,
"rewards/rejected": -2.9882047176361084,
"step": 424,
"train_speed(iter/s)": 0.021166
},
{
"epoch": 0.8583690987124464,
"grad_norm": 4.699946880340576,
"learning_rate": 0.00013121938074917865,
"logits/chosen": -1.0667518377304077,
"logits/rejected": -1.1017130613327026,
"logps/chosen": -4.643237113952637,
"logps/rejected": -60.97563934326172,
"loss": 0.39269566535949707,
"memory(GiB)": 45.64,
"nll_loss": 0.3167289197444916,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.22700132429599762,
"rewards/margins": 4.699875354766846,
"rewards/rejected": -4.472874641418457,
"step": 425,
"train_speed(iter/s)": 0.021167
},
{
"epoch": 0.8603887907094168,
"grad_norm": 2.7371695041656494,
"learning_rate": 0.00013090169943749476,
"logits/chosen": -1.076597809791565,
"logits/rejected": -1.0993525981903076,
"logps/chosen": -2.2984302043914795,
"logps/rejected": -54.213531494140625,
"loss": 0.3011862337589264,
"memory(GiB)": 45.64,
"nll_loss": 0.17973017692565918,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.19591867923736572,
"rewards/margins": 3.4975361824035645,
"rewards/rejected": -3.3016176223754883,
"step": 426,
"train_speed(iter/s)": 0.021168
},
{
"epoch": 0.8624084827063873,
"grad_norm": 17.75054168701172,
"learning_rate": 0.00013058367296140967,
"logits/chosen": -1.046842098236084,
"logits/rejected": -1.0758651494979858,
"logps/chosen": -4.21718692779541,
"logps/rejected": -39.91408920288086,
"loss": 0.9825822114944458,
"memory(GiB)": 45.64,
"nll_loss": 0.6494057774543762,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.017109857872128487,
"rewards/margins": 2.6019086837768555,
"rewards/rejected": -2.584798812866211,
"step": 427,
"train_speed(iter/s)": 0.021169
},
{
"epoch": 0.8644281747033578,
"grad_norm": 2.5992624759674072,
"learning_rate": 0.00013026530487320113,
"logits/chosen": -1.0623323917388916,
"logits/rejected": -1.1041500568389893,
"logps/chosen": -1.7210079431533813,
"logps/rejected": -52.09022521972656,
"loss": 0.3279334008693695,
"memory(GiB)": 45.64,
"nll_loss": 0.19231894612312317,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27669844031333923,
"rewards/margins": 4.07616662979126,
"rewards/rejected": -3.7994682788848877,
"step": 428,
"train_speed(iter/s)": 0.021169
},
{
"epoch": 0.8664478667003283,
"grad_norm": 3.9208383560180664,
"learning_rate": 0.00012994659872896257,
"logits/chosen": -1.0508674383163452,
"logits/rejected": -1.1102675199508667,
"logps/chosen": -3.953282594680786,
"logps/rejected": -63.04370880126953,
"loss": 0.7971250414848328,
"memory(GiB)": 45.64,
"nll_loss": 0.5409887433052063,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.06726647913455963,
"rewards/margins": 4.291454792022705,
"rewards/rejected": -4.224188327789307,
"step": 429,
"train_speed(iter/s)": 0.02117
},
{
"epoch": 0.8684675586972986,
"grad_norm": 2.1997742652893066,
"learning_rate": 0.00012962755808856342,
"logits/chosen": -1.0617396831512451,
"logits/rejected": -1.0978208780288696,
"logps/chosen": -1.448944330215454,
"logps/rejected": -47.621673583984375,
"loss": 0.17363907396793365,
"memory(GiB)": 45.64,
"nll_loss": 0.10171680897474289,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2539137005805969,
"rewards/margins": 3.7236616611480713,
"rewards/rejected": -3.4697484970092773,
"step": 430,
"train_speed(iter/s)": 0.02117
},
{
"epoch": 0.8704872506942691,
"grad_norm": 5.373311519622803,
"learning_rate": 0.00012930818651560934,
"logits/chosen": -1.015924096107483,
"logits/rejected": -1.0387259721755981,
"logps/chosen": -3.2455596923828125,
"logps/rejected": -39.7397575378418,
"loss": 0.8503936529159546,
"memory(GiB)": 45.64,
"nll_loss": 0.522122859954834,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.04042099043726921,
"rewards/margins": 2.7263174057006836,
"rewards/rejected": -2.7667384147644043,
"step": 431,
"train_speed(iter/s)": 0.021171
},
{
"epoch": 0.8725069426912396,
"grad_norm": 10.711043357849121,
"learning_rate": 0.00012898848757740246,
"logits/chosen": -0.9647800922393799,
"logits/rejected": -0.9854017496109009,
"logps/chosen": -9.754167556762695,
"logps/rejected": -35.71137619018555,
"loss": 1.1322778463363647,
"memory(GiB)": 45.64,
"nll_loss": 0.6833858489990234,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.09812775254249573,
"rewards/margins": 1.88960862159729,
"rewards/rejected": -1.7914810180664062,
"step": 432,
"train_speed(iter/s)": 0.021171
},
{
"epoch": 0.87452663468821,
"grad_norm": 6.029493808746338,
"learning_rate": 0.00012866846484490147,
"logits/chosen": -1.05926513671875,
"logits/rejected": -1.0726540088653564,
"logps/chosen": -1.8859708309173584,
"logps/rejected": -38.563228607177734,
"loss": 0.3466527760028839,
"memory(GiB)": 45.64,
"nll_loss": 0.2102343887090683,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.403474360704422,
"rewards/margins": 3.249852180480957,
"rewards/rejected": -2.8463780879974365,
"step": 433,
"train_speed(iter/s)": 0.021172
},
{
"epoch": 0.8765463266851805,
"grad_norm": 9.18895149230957,
"learning_rate": 0.0001283481218926818,
"logits/chosen": -1.060423731803894,
"logits/rejected": -1.0363166332244873,
"logps/chosen": -4.131833553314209,
"logps/rejected": -75.67689514160156,
"loss": 0.7851709723472595,
"memory(GiB)": 45.64,
"nll_loss": 0.5702386498451233,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1319551020860672,
"rewards/margins": 5.650537490844727,
"rewards/rejected": -5.518582820892334,
"step": 434,
"train_speed(iter/s)": 0.021172
},
{
"epoch": 0.878566018682151,
"grad_norm": 6.691397666931152,
"learning_rate": 0.00012802746229889563,
"logits/chosen": -1.0681829452514648,
"logits/rejected": -1.0891364812850952,
"logps/chosen": -1.9405295848846436,
"logps/rejected": -50.287044525146484,
"loss": 0.4823431670665741,
"memory(GiB)": 45.64,
"nll_loss": 0.2815513014793396,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.21010005474090576,
"rewards/margins": 3.8635170459747314,
"rewards/rejected": -3.653416633605957,
"step": 435,
"train_speed(iter/s)": 0.021173
},
{
"epoch": 0.8805857106791214,
"grad_norm": 4.134374141693115,
"learning_rate": 0.00012770648964523194,
"logits/chosen": -1.0445590019226074,
"logits/rejected": -1.0800678730010986,
"logps/chosen": -4.192701816558838,
"logps/rejected": -41.08876037597656,
"loss": 0.764896035194397,
"memory(GiB)": 45.64,
"nll_loss": 0.6386605501174927,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.05937701463699341,
"rewards/margins": 3.2779440879821777,
"rewards/rejected": -3.21856689453125,
"step": 436,
"train_speed(iter/s)": 0.021174
},
{
"epoch": 0.8826054026760919,
"grad_norm": 5.5645976066589355,
"learning_rate": 0.0001273852075168765,
"logits/chosen": -1.052649736404419,
"logits/rejected": -1.0750157833099365,
"logps/chosen": -3.2202606201171875,
"logps/rejected": -39.1766471862793,
"loss": 0.7316163778305054,
"memory(GiB)": 45.64,
"nll_loss": 0.35654330253601074,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.04998503625392914,
"rewards/margins": 2.966275453567505,
"rewards/rejected": -2.916290521621704,
"step": 437,
"train_speed(iter/s)": 0.021175
},
{
"epoch": 0.8846250946730624,
"grad_norm": 3.430967330932617,
"learning_rate": 0.0001270636195024719,
"logits/chosen": -1.0656282901763916,
"logits/rejected": -1.0755031108856201,
"logps/chosen": -0.5838297605514526,
"logps/rejected": -53.800167083740234,
"loss": 0.23027637600898743,
"memory(GiB)": 45.64,
"nll_loss": 0.11958169937133789,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.35133183002471924,
"rewards/margins": 4.607048034667969,
"rewards/rejected": -4.255716323852539,
"step": 438,
"train_speed(iter/s)": 0.021176
},
{
"epoch": 0.8866447866700328,
"grad_norm": 4.035180568695068,
"learning_rate": 0.00012674172919407734,
"logits/chosen": -1.035705327987671,
"logits/rejected": -1.046338677406311,
"logps/chosen": -1.762102484703064,
"logps/rejected": -41.274600982666016,
"loss": 0.44759538769721985,
"memory(GiB)": 45.64,
"nll_loss": 0.17419928312301636,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2473682463169098,
"rewards/margins": 3.196018695831299,
"rewards/rejected": -2.948650360107422,
"step": 439,
"train_speed(iter/s)": 0.021177
},
{
"epoch": 0.8886644786670033,
"grad_norm": 5.988144397735596,
"learning_rate": 0.00012641954018712863,
"logits/chosen": -1.0401451587677002,
"logits/rejected": -1.0481927394866943,
"logps/chosen": -1.6200381517410278,
"logps/rejected": -40.854026794433594,
"loss": 0.4076470732688904,
"memory(GiB)": 45.64,
"nll_loss": 0.28579434752464294,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2611207365989685,
"rewards/margins": 3.813446044921875,
"rewards/rejected": -3.5523252487182617,
"step": 440,
"train_speed(iter/s)": 0.021178
},
{
"epoch": 0.8906841706639738,
"grad_norm": 4.463588237762451,
"learning_rate": 0.00012609705608039782,
"logits/chosen": -1.0440635681152344,
"logits/rejected": -1.038417935371399,
"logps/chosen": -1.1576311588287354,
"logps/rejected": -78.23765563964844,
"loss": 0.2654612958431244,
"memory(GiB)": 45.64,
"nll_loss": 0.14011946320533752,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.31270933151245117,
"rewards/margins": 5.999755859375,
"rewards/rejected": -5.687046051025391,
"step": 441,
"train_speed(iter/s)": 0.021178
},
{
"epoch": 0.8927038626609443,
"grad_norm": 3.0731234550476074,
"learning_rate": 0.00012577428047595344,
"logits/chosen": -1.016157865524292,
"logits/rejected": -1.0280359983444214,
"logps/chosen": -3.0516724586486816,
"logps/rejected": -60.31180191040039,
"loss": 0.4081045091152191,
"memory(GiB)": 45.64,
"nll_loss": 0.23720964789390564,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2602730989456177,
"rewards/margins": 4.627702236175537,
"rewards/rejected": -4.367428779602051,
"step": 442,
"train_speed(iter/s)": 0.021178
},
{
"epoch": 0.8947235546579146,
"grad_norm": 2.895439624786377,
"learning_rate": 0.00012545121697911962,
"logits/chosen": -1.0191925764083862,
"logits/rejected": -1.0200212001800537,
"logps/chosen": -2.8940157890319824,
"logps/rejected": -57.44503402709961,
"loss": 0.36436915397644043,
"memory(GiB)": 45.64,
"nll_loss": 0.1371701955795288,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2842387855052948,
"rewards/margins": 4.40120792388916,
"rewards/rejected": -4.116969108581543,
"step": 443,
"train_speed(iter/s)": 0.021178
},
{
"epoch": 0.8967432466548851,
"grad_norm": 9.891191482543945,
"learning_rate": 0.00012512786919843648,
"logits/chosen": -1.0200165510177612,
"logits/rejected": -1.032355785369873,
"logps/chosen": -2.6891350746154785,
"logps/rejected": -47.72188949584961,
"loss": 0.7450097799301147,
"memory(GiB)": 45.64,
"nll_loss": 0.5138753652572632,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2414613664150238,
"rewards/margins": 4.151015281677246,
"rewards/rejected": -3.9095540046691895,
"step": 444,
"train_speed(iter/s)": 0.021179
},
{
"epoch": 0.8987629386518556,
"grad_norm": 3.1112067699432373,
"learning_rate": 0.00012480424074561933,
"logits/chosen": -1.025837779045105,
"logits/rejected": -1.0225645303726196,
"logps/chosen": -1.7361624240875244,
"logps/rejected": -58.649635314941406,
"loss": 0.2522731125354767,
"memory(GiB)": 45.64,
"nll_loss": 0.09138274937868118,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2967418134212494,
"rewards/margins": 4.663671970367432,
"rewards/rejected": -4.3669304847717285,
"step": 445,
"train_speed(iter/s)": 0.021179
},
{
"epoch": 0.900782630648826,
"grad_norm": 14.950603485107422,
"learning_rate": 0.00012448033523551865,
"logits/chosen": -1.0079376697540283,
"logits/rejected": -1.0010699033737183,
"logps/chosen": -7.840879440307617,
"logps/rejected": -26.104421615600586,
"loss": 1.1924169063568115,
"memory(GiB)": 45.64,
"nll_loss": 0.4921947121620178,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.1946742981672287,
"rewards/margins": 1.5733067989349365,
"rewards/rejected": -1.7679810523986816,
"step": 446,
"train_speed(iter/s)": 0.02118
},
{
"epoch": 0.9028023226457965,
"grad_norm": 3.8511011600494385,
"learning_rate": 0.00012415615628607945,
"logits/chosen": -1.015897274017334,
"logits/rejected": -1.014409065246582,
"logps/chosen": -2.20813250541687,
"logps/rejected": -45.50457763671875,
"loss": 0.5370233058929443,
"memory(GiB)": 45.64,
"nll_loss": 0.34335654973983765,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.12667731940746307,
"rewards/margins": 3.747370958328247,
"rewards/rejected": -3.6206939220428467,
"step": 447,
"train_speed(iter/s)": 0.021181
},
{
"epoch": 0.904822014642767,
"grad_norm": 4.594604969024658,
"learning_rate": 0.0001238317075183011,
"logits/chosen": -1.0298758745193481,
"logits/rejected": -1.0120558738708496,
"logps/chosen": -0.9791274070739746,
"logps/rejected": -79.58103942871094,
"loss": 0.3356885612010956,
"memory(GiB)": 45.64,
"nll_loss": 0.19914807379245758,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.22014901041984558,
"rewards/margins": 5.962551116943359,
"rewards/rejected": -5.742402076721191,
"step": 448,
"train_speed(iter/s)": 0.021181
},
{
"epoch": 0.9068417066397374,
"grad_norm": 3.488224983215332,
"learning_rate": 0.00012350699255619677,
"logits/chosen": -1.0189076662063599,
"logits/rejected": -1.0452524423599243,
"logps/chosen": -1.572611689567566,
"logps/rejected": -41.083641052246094,
"loss": 0.36099478602409363,
"memory(GiB)": 45.64,
"nll_loss": 0.19940336048603058,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20073141157627106,
"rewards/margins": 3.2094714641571045,
"rewards/rejected": -3.008740186691284,
"step": 449,
"train_speed(iter/s)": 0.021182
},
{
"epoch": 0.9088613986367079,
"grad_norm": 1.7710275650024414,
"learning_rate": 0.00012318201502675285,
"logits/chosen": -0.9990462064743042,
"logits/rejected": -1.00516939163208,
"logps/chosen": -1.445307731628418,
"logps/rejected": -54.3629035949707,
"loss": 0.2929742634296417,
"memory(GiB)": 45.64,
"nll_loss": 0.14184969663619995,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3061780631542206,
"rewards/margins": 4.353916645050049,
"rewards/rejected": -4.047738552093506,
"step": 450,
"train_speed(iter/s)": 0.021182
},
{
"epoch": 0.9108810906336784,
"grad_norm": 5.618566989898682,
"learning_rate": 0.00012285677855988864,
"logits/chosen": -1.0002800226211548,
"logits/rejected": -1.0010613203048706,
"logps/chosen": -3.4435813426971436,
"logps/rejected": -65.43953704833984,
"loss": 0.5797629952430725,
"memory(GiB)": 45.64,
"nll_loss": 0.2722090482711792,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.13838529586791992,
"rewards/margins": 4.899312973022461,
"rewards/rejected": -4.760928153991699,
"step": 451,
"train_speed(iter/s)": 0.021166
},
{
"epoch": 0.9129007826306488,
"grad_norm": 22.944427490234375,
"learning_rate": 0.00012253128678841568,
"logits/chosen": -1.011128544807434,
"logits/rejected": -1.0143555402755737,
"logps/chosen": -15.104331970214844,
"logps/rejected": -42.862266540527344,
"loss": 1.11042058467865,
"memory(GiB)": 45.64,
"nll_loss": 0.3811737298965454,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.3371947109699249,
"rewards/margins": 2.6465537548065186,
"rewards/rejected": -2.983748435974121,
"step": 452,
"train_speed(iter/s)": 0.021166
},
{
"epoch": 0.9149204746276193,
"grad_norm": 4.528737545013428,
"learning_rate": 0.0001222055433479972,
"logits/chosen": -1.0228255987167358,
"logits/rejected": -1.0586241483688354,
"logps/chosen": -1.2600595951080322,
"logps/rejected": -73.49124145507812,
"loss": 0.28426051139831543,
"memory(GiB)": 45.64,
"nll_loss": 0.14906807243824005,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2577366530895233,
"rewards/margins": 5.7026872634887695,
"rewards/rejected": -5.444951057434082,
"step": 453,
"train_speed(iter/s)": 0.021167
},
{
"epoch": 0.9169401666245898,
"grad_norm": 4.978267669677734,
"learning_rate": 0.0001218795518771075,
"logits/chosen": -1.0025545358657837,
"logits/rejected": -1.0025382041931152,
"logps/chosen": -0.9946606755256653,
"logps/rejected": -37.86664581298828,
"loss": 0.34124690294265747,
"memory(GiB)": 45.64,
"nll_loss": 0.09514570236206055,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.231367290019989,
"rewards/margins": 2.811678171157837,
"rewards/rejected": -2.580310821533203,
"step": 454,
"train_speed(iter/s)": 0.021168
},
{
"epoch": 0.9189598586215603,
"grad_norm": 5.106620788574219,
"learning_rate": 0.00012155331601699136,
"logits/chosen": -1.0310418605804443,
"logits/rejected": -1.0054916143417358,
"logps/chosen": -1.0205014944076538,
"logps/rejected": -85.00090026855469,
"loss": 0.18072457611560822,
"memory(GiB)": 45.64,
"nll_loss": 0.1114395335316658,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41535112261772156,
"rewards/margins": 6.101562023162842,
"rewards/rejected": -5.686211109161377,
"step": 455,
"train_speed(iter/s)": 0.021167
},
{
"epoch": 0.9209795506185307,
"grad_norm": 1.438368797302246,
"learning_rate": 0.0001212268394116233,
"logits/chosen": -1.0807647705078125,
"logits/rejected": -1.057398796081543,
"logps/chosen": -0.6302530765533447,
"logps/rejected": -55.822792053222656,
"loss": 0.25450506806373596,
"memory(GiB)": 45.64,
"nll_loss": 0.09770296514034271,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2143504023551941,
"rewards/margins": 4.336926460266113,
"rewards/rejected": -4.1225762367248535,
"step": 456,
"train_speed(iter/s)": 0.021168
},
{
"epoch": 0.9229992426155011,
"grad_norm": 2.4940450191497803,
"learning_rate": 0.00012090012570766685,
"logits/chosen": -1.047285556793213,
"logits/rejected": -1.0609232187271118,
"logps/chosen": -3.7559874057769775,
"logps/rejected": -58.776737213134766,
"loss": 0.2771581709384918,
"memory(GiB)": 45.64,
"nll_loss": 0.1527220904827118,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3420707583427429,
"rewards/margins": 5.054807662963867,
"rewards/rejected": -4.712737083435059,
"step": 457,
"train_speed(iter/s)": 0.021169
},
{
"epoch": 0.9250189346124716,
"grad_norm": 16.446552276611328,
"learning_rate": 0.00012057317855443395,
"logits/chosen": -1.1021456718444824,
"logits/rejected": -1.1048663854599,
"logps/chosen": -5.987412452697754,
"logps/rejected": -61.24203872680664,
"loss": 0.6597545742988586,
"memory(GiB)": 45.64,
"nll_loss": 0.40991318225860596,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.06934911757707596,
"rewards/margins": 4.689109802246094,
"rewards/rejected": -4.758459091186523,
"step": 458,
"train_speed(iter/s)": 0.021169
},
{
"epoch": 0.927038626609442,
"grad_norm": 2.537680149078369,
"learning_rate": 0.00012024600160384416,
"logits/chosen": -1.1070061922073364,
"logits/rejected": -1.1183254718780518,
"logps/chosen": -2.1882822513580322,
"logps/rejected": -94.47828674316406,
"loss": 0.47271794080734253,
"memory(GiB)": 45.64,
"nll_loss": 0.3363499641418457,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23398056626319885,
"rewards/margins": 7.600938320159912,
"rewards/rejected": -7.366957187652588,
"step": 459,
"train_speed(iter/s)": 0.021169
},
{
"epoch": 0.9290583186064125,
"grad_norm": 3.8238890171051025,
"learning_rate": 0.0001199185985103836,
"logits/chosen": -1.079871416091919,
"logits/rejected": -1.1050368547439575,
"logps/chosen": -0.6882074475288391,
"logps/rejected": -112.36473846435547,
"loss": 0.2024538367986679,
"memory(GiB)": 45.64,
"nll_loss": 0.1239171102643013,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.41684651374816895,
"rewards/margins": 8.971007347106934,
"rewards/rejected": -8.554160118103027,
"step": 460,
"train_speed(iter/s)": 0.021169
},
{
"epoch": 0.931078010603383,
"grad_norm": 7.065299987792969,
"learning_rate": 0.00011959097293106465,
"logits/chosen": -1.1408017873764038,
"logits/rejected": -1.1611324548721313,
"logps/chosen": -0.8949813842773438,
"logps/rejected": -44.59485626220703,
"loss": 0.26141998171806335,
"memory(GiB)": 45.64,
"nll_loss": 0.1390543431043625,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3610275685787201,
"rewards/margins": 3.8335914611816406,
"rewards/rejected": -3.4725637435913086,
"step": 461,
"train_speed(iter/s)": 0.02117
},
{
"epoch": 0.9330977026003534,
"grad_norm": 4.476932048797607,
"learning_rate": 0.00011926312852538455,
"logits/chosen": -1.128575086593628,
"logits/rejected": -1.157038688659668,
"logps/chosen": -3.6390225887298584,
"logps/rejected": -63.7474365234375,
"loss": 0.5282421708106995,
"memory(GiB)": 45.64,
"nll_loss": 0.2585342824459076,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11798002570867538,
"rewards/margins": 5.297179222106934,
"rewards/rejected": -5.179199695587158,
"step": 462,
"train_speed(iter/s)": 0.02117
},
{
"epoch": 0.9351173945973239,
"grad_norm": 11.82602310180664,
"learning_rate": 0.0001189350689552849,
"logits/chosen": -1.1367065906524658,
"logits/rejected": -1.156144618988037,
"logps/chosen": -1.9807525873184204,
"logps/rejected": -49.89271926879883,
"loss": 0.6038030385971069,
"memory(GiB)": 45.64,
"nll_loss": 0.34540605545043945,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.37543025612831116,
"rewards/margins": 4.289130687713623,
"rewards/rejected": -3.9137003421783447,
"step": 463,
"train_speed(iter/s)": 0.021171
},
{
"epoch": 0.9371370865942944,
"grad_norm": 12.497689247131348,
"learning_rate": 0.00011860679788511064,
"logits/chosen": -1.1170810461044312,
"logits/rejected": -1.1292904615402222,
"logps/chosen": -4.893659591674805,
"logps/rejected": -60.843013763427734,
"loss": 0.6962206363677979,
"memory(GiB)": 45.64,
"nll_loss": 0.4090201258659363,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10479210317134857,
"rewards/margins": 4.898015022277832,
"rewards/rejected": -4.793222427368164,
"step": 464,
"train_speed(iter/s)": 0.021172
},
{
"epoch": 0.9391567785912648,
"grad_norm": 2.3905272483825684,
"learning_rate": 0.00011827831898156905,
"logits/chosen": -1.119379997253418,
"logits/rejected": -1.0900958776474,
"logps/chosen": -1.0332272052764893,
"logps/rejected": -82.55847930908203,
"loss": 0.21928882598876953,
"memory(GiB)": 45.64,
"nll_loss": 0.14558973908424377,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.21076346933841705,
"rewards/margins": 6.53924560546875,
"rewards/rejected": -6.328482151031494,
"step": 465,
"train_speed(iter/s)": 0.021172
},
{
"epoch": 0.9411764705882353,
"grad_norm": 2.804384708404541,
"learning_rate": 0.00011794963591368893,
"logits/chosen": -1.1550871133804321,
"logits/rejected": -1.1876434087753296,
"logps/chosen": -1.962457299232483,
"logps/rejected": -91.43489837646484,
"loss": 0.26453521847724915,
"memory(GiB)": 45.64,
"nll_loss": 0.18894466757774353,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2565460503101349,
"rewards/margins": 7.109828472137451,
"rewards/rejected": -6.853282451629639,
"step": 466,
"train_speed(iter/s)": 0.021172
},
{
"epoch": 0.9431961625852058,
"grad_norm": 6.29252290725708,
"learning_rate": 0.00011762075235277943,
"logits/chosen": -1.1255277395248413,
"logits/rejected": -1.148550271987915,
"logps/chosen": -7.0823774337768555,
"logps/rejected": -84.76576232910156,
"loss": 0.7452417016029358,
"memory(GiB)": 45.64,
"nll_loss": 0.6746703386306763,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.21994975209236145,
"rewards/margins": 6.5102715492248535,
"rewards/rejected": -6.730221271514893,
"step": 467,
"train_speed(iter/s)": 0.021172
},
{
"epoch": 0.9452158545821763,
"grad_norm": 3.2159340381622314,
"learning_rate": 0.00011729167197238935,
"logits/chosen": -1.0966346263885498,
"logits/rejected": -1.103726863861084,
"logps/chosen": -4.399909496307373,
"logps/rejected": -42.98252487182617,
"loss": 0.7106723785400391,
"memory(GiB)": 45.64,
"nll_loss": 0.3980051279067993,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.04321293905377388,
"rewards/margins": 3.2986812591552734,
"rewards/rejected": -3.2554681301116943,
"step": 468,
"train_speed(iter/s)": 0.021173
},
{
"epoch": 0.9472355465791467,
"grad_norm": 3.3617236614227295,
"learning_rate": 0.00011696239844826571,
"logits/chosen": -1.1088882684707642,
"logits/rejected": -1.1284962892532349,
"logps/chosen": -1.639062762260437,
"logps/rejected": -72.10785675048828,
"loss": 0.24586933851242065,
"memory(GiB)": 45.64,
"nll_loss": 0.12198629230260849,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3906645178794861,
"rewards/margins": 6.221713066101074,
"rewards/rejected": -5.831048011779785,
"step": 469,
"train_speed(iter/s)": 0.021174
},
{
"epoch": 0.9492552385761172,
"grad_norm": 2.8374667167663574,
"learning_rate": 0.00011663293545831302,
"logits/chosen": -1.1557269096374512,
"logits/rejected": -1.175348162651062,
"logps/chosen": -2.1615452766418457,
"logps/rejected": -36.723304748535156,
"loss": 0.38634181022644043,
"memory(GiB)": 45.64,
"nll_loss": 0.22775641083717346,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3754770755767822,
"rewards/margins": 3.0530035495758057,
"rewards/rejected": -2.6775267124176025,
"step": 470,
"train_speed(iter/s)": 0.021175
},
{
"epoch": 0.9512749305730877,
"grad_norm": 11.482617378234863,
"learning_rate": 0.00011630328668255206,
"logits/chosen": -1.1401901245117188,
"logits/rejected": -1.1286134719848633,
"logps/chosen": -6.495123386383057,
"logps/rejected": -35.29318618774414,
"loss": 0.8619951009750366,
"memory(GiB)": 45.64,
"nll_loss": 0.5049220323562622,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.13930773735046387,
"rewards/margins": 2.6000585556030273,
"rewards/rejected": -2.4607508182525635,
"step": 471,
"train_speed(iter/s)": 0.021175
},
{
"epoch": 0.953294622570058,
"grad_norm": 3.4752252101898193,
"learning_rate": 0.00011597345580307875,
"logits/chosen": -1.162688970565796,
"logits/rejected": -1.192884922027588,
"logps/chosen": -2.404099225997925,
"logps/rejected": -56.021663665771484,
"loss": 0.3634865880012512,
"memory(GiB)": 45.64,
"nll_loss": 0.23837605118751526,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.12834902107715607,
"rewards/margins": 4.692193508148193,
"rewards/rejected": -4.563844203948975,
"step": 472,
"train_speed(iter/s)": 0.021176
},
{
"epoch": 0.9553143145670285,
"grad_norm": 2.5039899349212646,
"learning_rate": 0.0001156434465040231,
"logits/chosen": -1.1668778657913208,
"logits/rejected": -1.1930913925170898,
"logps/chosen": -3.766876697540283,
"logps/rejected": -63.9132194519043,
"loss": 0.3028702735900879,
"memory(GiB)": 45.64,
"nll_loss": 0.20875141024589539,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3659513592720032,
"rewards/margins": 5.140607833862305,
"rewards/rejected": -4.774656295776367,
"step": 473,
"train_speed(iter/s)": 0.021177
},
{
"epoch": 0.957334006563999,
"grad_norm": 2.068408250808716,
"learning_rate": 0.00011531326247150803,
"logits/chosen": -1.1649010181427002,
"logits/rejected": -1.1960549354553223,
"logps/chosen": -1.7281254529953003,
"logps/rejected": -72.08183288574219,
"loss": 0.3556201756000519,
"memory(GiB)": 45.64,
"nll_loss": 0.1918855905532837,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.12103867530822754,
"rewards/margins": 5.5760884284973145,
"rewards/rejected": -5.45504903793335,
"step": 474,
"train_speed(iter/s)": 0.021177
},
{
"epoch": 0.9593536985609694,
"grad_norm": 2.6573944091796875,
"learning_rate": 0.00011498290739360815,
"logits/chosen": -1.1912912130355835,
"logits/rejected": -1.1985927820205688,
"logps/chosen": -1.0083485841751099,
"logps/rejected": -56.71221923828125,
"loss": 0.2199336588382721,
"memory(GiB)": 45.64,
"nll_loss": 0.09299471974372864,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2724168002605438,
"rewards/margins": 4.650609493255615,
"rewards/rejected": -4.37819242477417,
"step": 475,
"train_speed(iter/s)": 0.021178
},
{
"epoch": 0.9613733905579399,
"grad_norm": 5.599519729614258,
"learning_rate": 0.00011465238496030868,
"logits/chosen": -1.186398983001709,
"logits/rejected": -1.2222926616668701,
"logps/chosen": -2.25126576423645,
"logps/rejected": -65.31526184082031,
"loss": 0.6140868067741394,
"memory(GiB)": 45.64,
"nll_loss": 0.350625216960907,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11485815793275833,
"rewards/margins": 5.405522346496582,
"rewards/rejected": -5.2906646728515625,
"step": 476,
"train_speed(iter/s)": 0.021178
},
{
"epoch": 0.9633930825549104,
"grad_norm": 1.3937158584594727,
"learning_rate": 0.00011432169886346404,
"logits/chosen": -1.1549639701843262,
"logits/rejected": -1.1829733848571777,
"logps/chosen": -2.5441954135894775,
"logps/rejected": -70.29151916503906,
"loss": 0.24065297842025757,
"memory(GiB)": 45.64,
"nll_loss": 0.1281718909740448,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2520023286342621,
"rewards/margins": 5.15536642074585,
"rewards/rejected": -4.903364181518555,
"step": 477,
"train_speed(iter/s)": 0.021179
},
{
"epoch": 0.9654127745518808,
"grad_norm": 3.0468287467956543,
"learning_rate": 0.00011399085279675687,
"logits/chosen": -1.1789178848266602,
"logits/rejected": -1.2163946628570557,
"logps/chosen": -4.268495082855225,
"logps/rejected": -53.77469253540039,
"loss": 0.40022939443588257,
"memory(GiB)": 45.64,
"nll_loss": 0.2632007300853729,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3904189169406891,
"rewards/margins": 4.054966926574707,
"rewards/rejected": -3.66454815864563,
"step": 478,
"train_speed(iter/s)": 0.021179
},
{
"epoch": 0.9674324665488513,
"grad_norm": 6.615331172943115,
"learning_rate": 0.00011365985045565648,
"logits/chosen": -1.1960713863372803,
"logits/rejected": -1.2022978067398071,
"logps/chosen": -4.764765739440918,
"logps/rejected": -46.24211120605469,
"loss": 0.8375652432441711,
"memory(GiB)": 45.64,
"nll_loss": 0.47868138551712036,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2317066639661789,
"rewards/margins": 3.9557816982269287,
"rewards/rejected": -3.7240753173828125,
"step": 479,
"train_speed(iter/s)": 0.02118
},
{
"epoch": 0.9694521585458218,
"grad_norm": 3.0518853664398193,
"learning_rate": 0.0001133286955373779,
"logits/chosen": -1.1568349599838257,
"logits/rejected": -1.1736950874328613,
"logps/chosen": -1.8058488368988037,
"logps/rejected": -63.62800979614258,
"loss": 0.3420032560825348,
"memory(GiB)": 45.64,
"nll_loss": 0.1940608024597168,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4025638699531555,
"rewards/margins": 5.4827446937561035,
"rewards/rejected": -5.080180644989014,
"step": 480,
"train_speed(iter/s)": 0.02118
},
{
"epoch": 0.9714718505427922,
"grad_norm": 6.214394569396973,
"learning_rate": 0.00011299739174084025,
"logits/chosen": -1.1839512586593628,
"logits/rejected": -1.2068456411361694,
"logps/chosen": -2.6526894569396973,
"logps/rejected": -55.63904571533203,
"loss": 0.44367533922195435,
"memory(GiB)": 45.64,
"nll_loss": 0.2684517502784729,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1775396466255188,
"rewards/margins": 4.404716968536377,
"rewards/rejected": -4.227177619934082,
"step": 481,
"train_speed(iter/s)": 0.021181
},
{
"epoch": 0.9734915425397627,
"grad_norm": 5.678071975708008,
"learning_rate": 0.0001126659427666257,
"logits/chosen": -1.1944388151168823,
"logits/rejected": -1.2148536443710327,
"logps/chosen": -2.0405924320220947,
"logps/rejected": -61.48400115966797,
"loss": 0.40944910049438477,
"memory(GiB)": 45.64,
"nll_loss": 0.23419791460037231,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34613850712776184,
"rewards/margins": 5.159732818603516,
"rewards/rejected": -4.813594341278076,
"step": 482,
"train_speed(iter/s)": 0.021182
},
{
"epoch": 0.9755112345367332,
"grad_norm": 26.189855575561523,
"learning_rate": 0.00011233435231693794,
"logits/chosen": -1.1763508319854736,
"logits/rejected": -1.195464015007019,
"logps/chosen": -9.439873695373535,
"logps/rejected": -40.02541732788086,
"loss": 1.6160178184509277,
"memory(GiB)": 45.64,
"nll_loss": 0.8637927174568176,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.2953401505947113,
"rewards/margins": 2.8487725257873535,
"rewards/rejected": -3.1441128253936768,
"step": 483,
"train_speed(iter/s)": 0.021182
},
{
"epoch": 0.9775309265337037,
"grad_norm": 3.0877511501312256,
"learning_rate": 0.00011200262409556097,
"logits/chosen": -1.1713593006134033,
"logits/rejected": -1.2405827045440674,
"logps/chosen": -1.0278502702713013,
"logps/rejected": -76.41952514648438,
"loss": 0.28457099199295044,
"memory(GiB)": 45.64,
"nll_loss": 0.20625659823417664,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.32308924198150635,
"rewards/margins": 6.389144420623779,
"rewards/rejected": -6.066054821014404,
"step": 484,
"train_speed(iter/s)": 0.021182
},
{
"epoch": 0.979550618530674,
"grad_norm": 9.65100383758545,
"learning_rate": 0.00011167076180781764,
"logits/chosen": -1.146728277206421,
"logits/rejected": -1.2022031545639038,
"logps/chosen": -5.121095657348633,
"logps/rejected": -74.87187957763672,
"loss": 0.5169023871421814,
"memory(GiB)": 45.64,
"nll_loss": 0.4096004366874695,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2158682644367218,
"rewards/margins": 5.7417778968811035,
"rewards/rejected": -5.525909900665283,
"step": 485,
"train_speed(iter/s)": 0.021182
},
{
"epoch": 0.9815703105276445,
"grad_norm": 3.232163190841675,
"learning_rate": 0.00011133876916052821,
"logits/chosen": -1.1618849039077759,
"logits/rejected": -1.19745934009552,
"logps/chosen": -4.945662498474121,
"logps/rejected": -65.05085754394531,
"loss": 0.3440502882003784,
"memory(GiB)": 45.64,
"nll_loss": 0.2677401304244995,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.08972585201263428,
"rewards/margins": 5.094820976257324,
"rewards/rejected": -5.0050950050354,
"step": 486,
"train_speed(iter/s)": 0.021183
},
{
"epoch": 0.983590002524615,
"grad_norm": 1.1338063478469849,
"learning_rate": 0.0001110066498619692,
"logits/chosen": -1.1489181518554688,
"logits/rejected": -1.1883840560913086,
"logps/chosen": -0.9724054336547852,
"logps/rejected": -69.8716812133789,
"loss": 0.16405296325683594,
"memory(GiB)": 45.64,
"nll_loss": 0.1183013990521431,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.37503695487976074,
"rewards/margins": 6.176860809326172,
"rewards/rejected": -5.801823616027832,
"step": 487,
"train_speed(iter/s)": 0.021183
},
{
"epoch": 0.9856096945215854,
"grad_norm": 4.550635814666748,
"learning_rate": 0.00011067440762183164,
"logits/chosen": -1.127516508102417,
"logits/rejected": -1.1615864038467407,
"logps/chosen": -1.5935579538345337,
"logps/rejected": -70.34913635253906,
"loss": 0.32236579060554504,
"memory(GiB)": 45.64,
"nll_loss": 0.21638807654380798,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.30907154083251953,
"rewards/margins": 4.958349704742432,
"rewards/rejected": -4.649278163909912,
"step": 488,
"train_speed(iter/s)": 0.021183
},
{
"epoch": 0.9876293865185559,
"grad_norm": 4.5942206382751465,
"learning_rate": 0.00011034204615117982,
"logits/chosen": -1.1207928657531738,
"logits/rejected": -1.1431444883346558,
"logps/chosen": -2.02649188041687,
"logps/rejected": -69.4359359741211,
"loss": 0.45521846413612366,
"memory(GiB)": 45.64,
"nll_loss": 0.2501518428325653,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21566975116729736,
"rewards/margins": 4.797036647796631,
"rewards/rejected": -4.581367492675781,
"step": 489,
"train_speed(iter/s)": 0.021183
},
{
"epoch": 0.9896490785155264,
"grad_norm": 3.483578681945801,
"learning_rate": 0.00011000956916240985,
"logits/chosen": -1.1226303577423096,
"logits/rejected": -1.1501247882843018,
"logps/chosen": -5.958000659942627,
"logps/rejected": -32.57322311401367,
"loss": 0.6992753148078918,
"memory(GiB)": 45.64,
"nll_loss": 0.5034775137901306,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.47746312618255615,
"rewards/margins": 2.7217843532562256,
"rewards/rejected": -2.24432110786438,
"step": 490,
"train_speed(iter/s)": 0.021184
},
{
"epoch": 0.9916687705124968,
"grad_norm": 4.195751667022705,
"learning_rate": 0.00010967698036920812,
"logits/chosen": -1.10448157787323,
"logits/rejected": -1.1570674180984497,
"logps/chosen": -4.190779685974121,
"logps/rejected": -60.6494255065918,
"loss": 0.5290452837944031,
"memory(GiB)": 45.64,
"nll_loss": 0.3574896454811096,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.35892462730407715,
"rewards/margins": 4.584457874298096,
"rewards/rejected": -4.225533485412598,
"step": 491,
"train_speed(iter/s)": 0.021184
},
{
"epoch": 0.9936884625094673,
"grad_norm": 1.556215524673462,
"learning_rate": 0.00010934428348650986,
"logits/chosen": -1.1513900756835938,
"logits/rejected": -1.1773016452789307,
"logps/chosen": -0.4516194462776184,
"logps/rejected": -54.02649688720703,
"loss": 0.15559712052345276,
"memory(GiB)": 45.64,
"nll_loss": 0.06051451712846756,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3142217993736267,
"rewards/margins": 4.602743148803711,
"rewards/rejected": -4.2885212898254395,
"step": 492,
"train_speed(iter/s)": 0.021185
},
{
"epoch": 0.9957081545064378,
"grad_norm": 1.837632656097412,
"learning_rate": 0.00010901148223045761,
"logits/chosen": -1.122188925743103,
"logits/rejected": -1.1630114316940308,
"logps/chosen": -1.2533413171768188,
"logps/rejected": -65.71454620361328,
"loss": 0.23370426893234253,
"memory(GiB)": 45.64,
"nll_loss": 0.1294473558664322,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34939849376678467,
"rewards/margins": 4.393534183502197,
"rewards/rejected": -4.044135093688965,
"step": 493,
"train_speed(iter/s)": 0.021185
},
{
"epoch": 0.9977278465034082,
"grad_norm": 5.143455982208252,
"learning_rate": 0.00010867858031835975,
"logits/chosen": -1.160941481590271,
"logits/rejected": -1.1693061590194702,
"logps/chosen": -2.2333078384399414,
"logps/rejected": -62.20633316040039,
"loss": 0.33971500396728516,
"memory(GiB)": 45.64,
"nll_loss": 0.23756271600723267,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.17624695599079132,
"rewards/margins": 5.301555633544922,
"rewards/rejected": -5.125308513641357,
"step": 494,
"train_speed(iter/s)": 0.021186
},
{
"epoch": 0.9997475385003787,
"grad_norm": 1.6146841049194336,
"learning_rate": 0.000108345581468649,
"logits/chosen": -1.156958818435669,
"logits/rejected": -1.2084702253341675,
"logps/chosen": -1.2683087587356567,
"logps/rejected": -73.02035522460938,
"loss": 0.2508525550365448,
"memory(GiB)": 45.64,
"nll_loss": 0.12798351049423218,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.23698541522026062,
"rewards/margins": 5.670597553253174,
"rewards/rejected": -5.433611869812012,
"step": 495,
"train_speed(iter/s)": 0.021186
},
{
"epoch": 1.0,
"grad_norm": 1.6146841049194336,
"learning_rate": 0.00010801248940084074,
"logits/chosen": -1.271807074546814,
"logits/rejected": -1.3348701000213623,
"logps/chosen": -4.720621291198768e-05,
"logps/rejected": -91.26646423339844,
"loss": 1.2297836292418651e-05,
"memory(GiB)": 45.64,
"nll_loss": 7.867701242503244e-06,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5421666502952576,
"rewards/margins": 9.30994987487793,
"rewards/rejected": -8.767783164978027,
"step": 496,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 1.0020196919969704,
"grad_norm": 2.052020311355591,
"learning_rate": 0.00010767930783549171,
"logits/chosen": -1.1468470096588135,
"logits/rejected": -1.1875897645950317,
"logps/chosen": -1.5805768966674805,
"logps/rejected": -60.07487869262695,
"loss": 0.35193732380867004,
"memory(GiB)": 45.64,
"nll_loss": 0.22589635848999023,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.43169844150543213,
"rewards/margins": 4.954350471496582,
"rewards/rejected": -4.522652626037598,
"step": 497,
"train_speed(iter/s)": 0.021223
},
{
"epoch": 1.004039383993941,
"grad_norm": 3.080597400665283,
"learning_rate": 0.00010734604049415822,
"logits/chosen": -1.1931610107421875,
"logits/rejected": -1.2040530443191528,
"logps/chosen": -0.3329848051071167,
"logps/rejected": -89.8782730102539,
"loss": 0.08142131567001343,
"memory(GiB)": 45.64,
"nll_loss": 0.028553346171975136,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3950589895248413,
"rewards/margins": 7.771610260009766,
"rewards/rejected": -7.376551628112793,
"step": 498,
"train_speed(iter/s)": 0.021224
},
{
"epoch": 1.0060590759909114,
"grad_norm": 1.200395941734314,
"learning_rate": 0.00010701269109935474,
"logits/chosen": -1.1844416856765747,
"logits/rejected": -1.216762900352478,
"logps/chosen": -2.2689549922943115,
"logps/rejected": -74.18507385253906,
"loss": 0.18864388763904572,
"memory(GiB)": 45.64,
"nll_loss": 0.13327570259571075,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5378884673118591,
"rewards/margins": 6.781070709228516,
"rewards/rejected": -6.2431817054748535,
"step": 499,
"train_speed(iter/s)": 0.021224
},
{
"epoch": 1.0080787679878818,
"grad_norm": 1.3004249334335327,
"learning_rate": 0.00010667926337451217,
"logits/chosen": -1.2056668996810913,
"logits/rejected": -1.2564384937286377,
"logps/chosen": -2.1434969902038574,
"logps/rejected": -107.59019470214844,
"loss": 0.14688310027122498,
"memory(GiB)": 45.64,
"nll_loss": 0.1056690588593483,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.18269282579421997,
"rewards/margins": 9.098722457885742,
"rewards/rejected": -8.916029930114746,
"step": 500,
"train_speed(iter/s)": 0.021224
},
{
"epoch": 1.0100984599848524,
"grad_norm": 10.15276050567627,
"learning_rate": 0.00010634576104393643,
"logits/chosen": -1.2333784103393555,
"logits/rejected": -1.2786855697631836,
"logps/chosen": -1.4780651330947876,
"logps/rejected": -113.30062866210938,
"loss": 0.33663061261177063,
"memory(GiB)": 45.64,
"nll_loss": 0.18906863033771515,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.19989997148513794,
"rewards/margins": 9.928545951843262,
"rewards/rejected": -9.728645324707031,
"step": 501,
"train_speed(iter/s)": 0.021209
},
{
"epoch": 1.0121181519818228,
"grad_norm": 1.6605217456817627,
"learning_rate": 0.00010601218783276672,
"logits/chosen": -1.224414348602295,
"logits/rejected": -1.286801815032959,
"logps/chosen": -0.5362107753753662,
"logps/rejected": -101.3456802368164,
"loss": 0.1514112651348114,
"memory(GiB)": 45.64,
"nll_loss": 0.07159439474344254,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.21423012018203735,
"rewards/margins": 8.556539535522461,
"rewards/rejected": -8.342309951782227,
"step": 502,
"train_speed(iter/s)": 0.021209
},
{
"epoch": 1.0141378439787931,
"grad_norm": 12.038124084472656,
"learning_rate": 0.00010567854746693396,
"logits/chosen": -1.2550753355026245,
"logits/rejected": -1.3067824840545654,
"logps/chosen": -4.968113899230957,
"logps/rejected": -76.51419067382812,
"loss": 0.6970563530921936,
"memory(GiB)": 45.64,
"nll_loss": 0.5403850674629211,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.015964236110448837,
"rewards/margins": 6.770257472991943,
"rewards/rejected": -6.7542924880981445,
"step": 503,
"train_speed(iter/s)": 0.02121
},
{
"epoch": 1.0161575359757637,
"grad_norm": 5.976532936096191,
"learning_rate": 0.00010534484367311923,
"logits/chosen": -1.2590959072113037,
"logits/rejected": -1.3068499565124512,
"logps/chosen": -2.158994436264038,
"logps/rejected": -74.8353271484375,
"loss": 0.34383249282836914,
"memory(GiB)": 45.64,
"nll_loss": 0.22420844435691833,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4135916233062744,
"rewards/margins": 6.9369611740112305,
"rewards/rejected": -6.523369789123535,
"step": 504,
"train_speed(iter/s)": 0.02121
},
{
"epoch": 1.0181772279727341,
"grad_norm": 8.177599906921387,
"learning_rate": 0.00010501108017871192,
"logits/chosen": -1.2204450368881226,
"logits/rejected": -1.2789673805236816,
"logps/chosen": -1.5879818201065063,
"logps/rejected": -66.489990234375,
"loss": 0.35112184286117554,
"memory(GiB)": 45.64,
"nll_loss": 0.18649819493293762,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.41614973545074463,
"rewards/margins": 5.6356306076049805,
"rewards/rejected": -5.219481468200684,
"step": 505,
"train_speed(iter/s)": 0.021211
},
{
"epoch": 1.0201969199697045,
"grad_norm": 1.072225570678711,
"learning_rate": 0.00010467726071176853,
"logits/chosen": -1.2156474590301514,
"logits/rejected": -1.2541887760162354,
"logps/chosen": -7.711733341217041,
"logps/rejected": -65.3000717163086,
"loss": 0.1724158525466919,
"memory(GiB)": 45.64,
"nll_loss": 0.12215537577867508,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6666063070297241,
"rewards/margins": 6.159120559692383,
"rewards/rejected": -5.492514133453369,
"step": 506,
"train_speed(iter/s)": 0.021211
},
{
"epoch": 1.0222166119666751,
"grad_norm": 2.4010398387908936,
"learning_rate": 0.00010434338900097049,
"logits/chosen": -1.2528554201126099,
"logits/rejected": -1.3154045343399048,
"logps/chosen": -0.8416248559951782,
"logps/rejected": -69.87122344970703,
"loss": 0.12864626944065094,
"memory(GiB)": 45.64,
"nll_loss": 0.07988111674785614,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31406697630882263,
"rewards/margins": 6.217660903930664,
"rewards/rejected": -5.903594493865967,
"step": 507,
"train_speed(iter/s)": 0.021212
},
{
"epoch": 1.0242363039636455,
"grad_norm": 1.6103118658065796,
"learning_rate": 0.00010400946877558293,
"logits/chosen": -1.171745777130127,
"logits/rejected": -1.205277919769287,
"logps/chosen": -1.2725749015808105,
"logps/rejected": -75.42990112304688,
"loss": 0.17115575075149536,
"memory(GiB)": 45.64,
"nll_loss": 0.11690245568752289,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.42929667234420776,
"rewards/margins": 5.8164963722229,
"rewards/rejected": -5.387199878692627,
"step": 508,
"train_speed(iter/s)": 0.021212
},
{
"epoch": 1.0262559959606161,
"grad_norm": 7.029423713684082,
"learning_rate": 0.00010367550376541283,
"logits/chosen": -1.205200433731079,
"logits/rejected": -1.2511245012283325,
"logps/chosen": -2.5946669578552246,
"logps/rejected": -84.32099914550781,
"loss": 0.30733728408813477,
"memory(GiB)": 45.64,
"nll_loss": 0.2792370319366455,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.25035470724105835,
"rewards/margins": 6.80730676651001,
"rewards/rejected": -6.556951999664307,
"step": 509,
"train_speed(iter/s)": 0.021213
},
{
"epoch": 1.0282756879575865,
"grad_norm": 0.7719494700431824,
"learning_rate": 0.00010334149770076747,
"logits/chosen": -1.2033907175064087,
"logits/rejected": -1.2671985626220703,
"logps/chosen": -0.1477760523557663,
"logps/rejected": -67.04902648925781,
"loss": 0.06301882117986679,
"memory(GiB)": 45.64,
"nll_loss": 0.029819779098033905,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3393843173980713,
"rewards/margins": 5.922677516937256,
"rewards/rejected": -5.5832929611206055,
"step": 510,
"train_speed(iter/s)": 0.021213
},
{
"epoch": 1.030295379954557,
"grad_norm": 6.209945201873779,
"learning_rate": 0.00010300745431241259,
"logits/chosen": -1.1784838438034058,
"logits/rejected": -1.2575358152389526,
"logps/chosen": -2.9259207248687744,
"logps/rejected": -66.25347137451172,
"loss": 0.493066668510437,
"memory(GiB)": 45.64,
"nll_loss": 0.34985142946243286,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2988048195838928,
"rewards/margins": 5.669159412384033,
"rewards/rejected": -5.370354652404785,
"step": 511,
"train_speed(iter/s)": 0.021214
},
{
"epoch": 1.0323150719515275,
"grad_norm": 14.864357948303223,
"learning_rate": 0.00010267337733153089,
"logits/chosen": -1.211972951889038,
"logits/rejected": -1.2457599639892578,
"logps/chosen": -4.108205795288086,
"logps/rejected": -49.29187774658203,
"loss": 0.7474625110626221,
"memory(GiB)": 45.64,
"nll_loss": 0.5005552768707275,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1060146689414978,
"rewards/margins": 3.993147134780884,
"rewards/rejected": -3.8871326446533203,
"step": 512,
"train_speed(iter/s)": 0.021214
},
{
"epoch": 1.0343347639484979,
"grad_norm": 4.5455522537231445,
"learning_rate": 0.0001023392704896803,
"logits/chosen": -1.1689393520355225,
"logits/rejected": -1.1586272716522217,
"logps/chosen": -2.678110361099243,
"logps/rejected": -66.11392974853516,
"loss": 0.3088136315345764,
"memory(GiB)": 45.64,
"nll_loss": 0.2110619693994522,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2811347544193268,
"rewards/margins": 5.262904167175293,
"rewards/rejected": -4.981769561767578,
"step": 513,
"train_speed(iter/s)": 0.021214
},
{
"epoch": 1.0363544559454683,
"grad_norm": 6.412376880645752,
"learning_rate": 0.00010200513751875227,
"logits/chosen": -1.1625449657440186,
"logits/rejected": -1.1948907375335693,
"logps/chosen": -2.3596391677856445,
"logps/rejected": -68.15946197509766,
"loss": 0.39961010217666626,
"memory(GiB)": 45.64,
"nll_loss": 0.26144012808799744,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3064810037612915,
"rewards/margins": 5.5451202392578125,
"rewards/rejected": -5.2386393547058105,
"step": 514,
"train_speed(iter/s)": 0.021215
},
{
"epoch": 1.0383741479424389,
"grad_norm": 2.85520601272583,
"learning_rate": 0.00010167098215093009,
"logits/chosen": -1.1633456945419312,
"logits/rejected": -1.2228730916976929,
"logps/chosen": -3.7188360691070557,
"logps/rejected": -95.9930419921875,
"loss": 0.2916540801525116,
"memory(GiB)": 45.64,
"nll_loss": 0.23056216537952423,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3937748074531555,
"rewards/margins": 7.421454429626465,
"rewards/rejected": -7.027679443359375,
"step": 515,
"train_speed(iter/s)": 0.021214
},
{
"epoch": 1.0403938399394093,
"grad_norm": 5.375782012939453,
"learning_rate": 0.00010133680811864727,
"logits/chosen": -1.1782926321029663,
"logits/rejected": -1.2417353391647339,
"logps/chosen": -1.3107043504714966,
"logps/rejected": -53.36506652832031,
"loss": 0.19477064907550812,
"memory(GiB)": 45.64,
"nll_loss": 0.14968222379684448,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.25208836793899536,
"rewards/margins": 4.3324995040893555,
"rewards/rejected": -4.080410957336426,
"step": 516,
"train_speed(iter/s)": 0.021215
},
{
"epoch": 1.0424135319363796,
"grad_norm": 1.9422154426574707,
"learning_rate": 0.00010100261915454571,
"logits/chosen": -1.1514760255813599,
"logits/rejected": -1.2427828311920166,
"logps/chosen": -0.6266792416572571,
"logps/rejected": -79.95481872558594,
"loss": 0.09264641255140305,
"memory(GiB)": 45.64,
"nll_loss": 0.06077795848250389,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.45081964135169983,
"rewards/margins": 6.714786529541016,
"rewards/rejected": -6.263967037200928,
"step": 517,
"train_speed(iter/s)": 0.021215
},
{
"epoch": 1.0444332239333503,
"grad_norm": 20.16422462463379,
"learning_rate": 0.00010066841899143425,
"logits/chosen": -1.1963735818862915,
"logits/rejected": -1.2633908987045288,
"logps/chosen": -6.527058124542236,
"logps/rejected": -39.10000991821289,
"loss": 0.7584791779518127,
"memory(GiB)": 45.64,
"nll_loss": 0.5177947878837585,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3015112280845642,
"rewards/margins": 3.383577585220337,
"rewards/rejected": -3.082066535949707,
"step": 518,
"train_speed(iter/s)": 0.021215
},
{
"epoch": 1.0464529159303206,
"grad_norm": 7.269643783569336,
"learning_rate": 0.00010033421136224659,
"logits/chosen": -1.1538660526275635,
"logits/rejected": -1.1920374631881714,
"logps/chosen": -1.6170885562896729,
"logps/rejected": -57.34727096557617,
"loss": 0.1741914451122284,
"memory(GiB)": 45.64,
"nll_loss": 0.11453510820865631,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2959902584552765,
"rewards/margins": 4.944981575012207,
"rewards/rejected": -4.648991584777832,
"step": 519,
"train_speed(iter/s)": 0.021216
},
{
"epoch": 1.048472607927291,
"grad_norm": 2.5758349895477295,
"learning_rate": 0.0001,
"logits/chosen": -1.1641168594360352,
"logits/rejected": -1.2306013107299805,
"logps/chosen": -2.8853821754455566,
"logps/rejected": -45.58841323852539,
"loss": 0.35295766592025757,
"memory(GiB)": 45.64,
"nll_loss": 0.2536754012107849,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34334903955459595,
"rewards/margins": 3.8398725986480713,
"rewards/rejected": -3.49652361869812,
"step": 520,
"train_speed(iter/s)": 0.021217
},
{
"epoch": 1.0504922999242616,
"grad_norm": 3.192835569381714,
"learning_rate": 9.966578863775344e-05,
"logits/chosen": -1.1690419912338257,
"logits/rejected": -1.2847118377685547,
"logps/chosen": -1.6086413860321045,
"logps/rejected": -75.8061294555664,
"loss": 0.2794322371482849,
"memory(GiB)": 45.64,
"nll_loss": 0.20665356516838074,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3336547017097473,
"rewards/margins": 6.422711372375488,
"rewards/rejected": -6.089056491851807,
"step": 521,
"train_speed(iter/s)": 0.021217
},
{
"epoch": 1.052511991921232,
"grad_norm": 5.373813629150391,
"learning_rate": 9.93315810085658e-05,
"logits/chosen": -1.099102258682251,
"logits/rejected": -1.2499687671661377,
"logps/chosen": -0.8937387466430664,
"logps/rejected": -83.5426254272461,
"loss": 0.22286824882030487,
"memory(GiB)": 45.64,
"nll_loss": 0.1412465125322342,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34925389289855957,
"rewards/margins": 6.224581718444824,
"rewards/rejected": -5.8753275871276855,
"step": 522,
"train_speed(iter/s)": 0.021217
},
{
"epoch": 1.0545316839182024,
"grad_norm": 1.588864803314209,
"learning_rate": 9.89973808454543e-05,
"logits/chosen": -1.2088499069213867,
"logits/rejected": -1.2908425331115723,
"logps/chosen": -1.425804615020752,
"logps/rejected": -84.73382568359375,
"loss": 0.24856942892074585,
"memory(GiB)": 45.64,
"nll_loss": 0.17529940605163574,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.33582112193107605,
"rewards/margins": 7.493390083312988,
"rewards/rejected": -7.157568454742432,
"step": 523,
"train_speed(iter/s)": 0.021218
},
{
"epoch": 1.056551375915173,
"grad_norm": 11.534995079040527,
"learning_rate": 9.866319188135274e-05,
"logits/chosen": -1.155828833580017,
"logits/rejected": -1.226155400276184,
"logps/chosen": -2.9224207401275635,
"logps/rejected": -76.7179946899414,
"loss": 0.39948102831840515,
"memory(GiB)": 45.64,
"nll_loss": 0.28366178274154663,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.40342777967453003,
"rewards/margins": 6.173599720001221,
"rewards/rejected": -5.770172119140625,
"step": 524,
"train_speed(iter/s)": 0.021218
},
{
"epoch": 1.0585710679121434,
"grad_norm": 3.017298936843872,
"learning_rate": 9.83290178490699e-05,
"logits/chosen": -1.2128490209579468,
"logits/rejected": -1.3072235584259033,
"logps/chosen": -2.281188488006592,
"logps/rejected": -75.67351531982422,
"loss": 0.28667759895324707,
"memory(GiB)": 45.64,
"nll_loss": 0.2029131054878235,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27607351541519165,
"rewards/margins": 6.455198287963867,
"rewards/rejected": -6.17912483215332,
"step": 525,
"train_speed(iter/s)": 0.021218
},
{
"epoch": 1.0605907599091138,
"grad_norm": 2.768603563308716,
"learning_rate": 9.799486248124775e-05,
"logits/chosen": -1.1740716695785522,
"logits/rejected": -1.267440915107727,
"logps/chosen": -3.626737594604492,
"logps/rejected": -79.38348388671875,
"loss": 0.2453736811876297,
"memory(GiB)": 45.64,
"nll_loss": 0.15417639911174774,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.7520807385444641,
"rewards/margins": 7.059826850891113,
"rewards/rejected": -6.307745933532715,
"step": 526,
"train_speed(iter/s)": 0.021218
},
{
"epoch": 1.0626104519060844,
"grad_norm": 2.207165002822876,
"learning_rate": 9.766072951031972e-05,
"logits/chosen": -1.2672584056854248,
"logits/rejected": -1.32329261302948,
"logps/chosen": -1.5716861486434937,
"logps/rejected": -68.19523620605469,
"loss": 0.20522795617580414,
"memory(GiB)": 45.64,
"nll_loss": 0.16552022099494934,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3385736048221588,
"rewards/margins": 5.919947624206543,
"rewards/rejected": -5.581373691558838,
"step": 527,
"train_speed(iter/s)": 0.021219
},
{
"epoch": 1.0646301439030548,
"grad_norm": 1.6318920850753784,
"learning_rate": 9.732662266846912e-05,
"logits/chosen": -1.157897710800171,
"logits/rejected": -1.2902889251708984,
"logps/chosen": -1.1771454811096191,
"logps/rejected": -94.12054443359375,
"loss": 0.21492774784564972,
"memory(GiB)": 45.64,
"nll_loss": 0.17460428178310394,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3003194034099579,
"rewards/margins": 8.205141067504883,
"rewards/rejected": -7.904821395874023,
"step": 528,
"train_speed(iter/s)": 0.021219
},
{
"epoch": 1.0666498359000252,
"grad_norm": 5.924353122711182,
"learning_rate": 9.699254568758741e-05,
"logits/chosen": -1.2643760442733765,
"logits/rejected": -1.368143081665039,
"logps/chosen": -1.368375301361084,
"logps/rejected": -86.12940979003906,
"loss": 0.14123007655143738,
"memory(GiB)": 45.64,
"nll_loss": 0.11123973876237869,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3200608789920807,
"rewards/margins": 7.876832008361816,
"rewards/rejected": -7.556771278381348,
"step": 529,
"train_speed(iter/s)": 0.021219
},
{
"epoch": 1.0686695278969958,
"grad_norm": 1.9186508655548096,
"learning_rate": 9.665850229923258e-05,
"logits/chosen": -1.2655577659606934,
"logits/rejected": -1.344153642654419,
"logps/chosen": -0.23585116863250732,
"logps/rejected": -80.97904968261719,
"loss": 0.11053043603897095,
"memory(GiB)": 45.64,
"nll_loss": 0.04247582331299782,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3903675675392151,
"rewards/margins": 7.256943702697754,
"rewards/rejected": -6.866576194763184,
"step": 530,
"train_speed(iter/s)": 0.02122
},
{
"epoch": 1.0706892198939661,
"grad_norm": 1.6089398860931396,
"learning_rate": 9.632449623458718e-05,
"logits/chosen": -1.2310450077056885,
"logits/rejected": -1.306509256362915,
"logps/chosen": -1.039363145828247,
"logps/rejected": -56.28333282470703,
"loss": 0.18445441126823425,
"memory(GiB)": 45.64,
"nll_loss": 0.09440238028764725,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4418891668319702,
"rewards/margins": 4.846897602081299,
"rewards/rejected": -4.405008792877197,
"step": 531,
"train_speed(iter/s)": 0.021221
},
{
"epoch": 1.0727089118909365,
"grad_norm": 4.852963447570801,
"learning_rate": 9.59905312244171e-05,
"logits/chosen": -1.2377697229385376,
"logits/rejected": -1.3623260259628296,
"logps/chosen": -0.7856588363647461,
"logps/rejected": -99.22467041015625,
"loss": 0.1534590870141983,
"memory(GiB)": 45.64,
"nll_loss": 0.11053737998008728,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.27947190403938293,
"rewards/margins": 8.624140739440918,
"rewards/rejected": -8.3446683883667,
"step": 532,
"train_speed(iter/s)": 0.021221
},
{
"epoch": 1.0747286038879071,
"grad_norm": 10.742178916931152,
"learning_rate": 9.565661099902952e-05,
"logits/chosen": -1.1463772058486938,
"logits/rejected": -1.2955669164657593,
"logps/chosen": -3.547930955886841,
"logps/rejected": -82.50328063964844,
"loss": 0.657089352607727,
"memory(GiB)": 45.64,
"nll_loss": 0.4685670733451843,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.0838821679353714,
"rewards/margins": 6.732100009918213,
"rewards/rejected": -6.64821720123291,
"step": 533,
"train_speed(iter/s)": 0.021221
},
{
"epoch": 1.0767482958848775,
"grad_norm": 1.633371114730835,
"learning_rate": 9.532273928823151e-05,
"logits/chosen": -1.2212746143341064,
"logits/rejected": -1.269982099533081,
"logps/chosen": -3.351022243499756,
"logps/rejected": -92.98002624511719,
"loss": 0.20061077177524567,
"memory(GiB)": 45.64,
"nll_loss": 0.09750235080718994,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.6985870599746704,
"rewards/margins": 7.949156284332275,
"rewards/rejected": -7.250568389892578,
"step": 534,
"train_speed(iter/s)": 0.021221
},
{
"epoch": 1.078767987881848,
"grad_norm": 1.1351590156555176,
"learning_rate": 9.498891982128809e-05,
"logits/chosen": -1.2288845777511597,
"logits/rejected": -1.3357539176940918,
"logps/chosen": -0.435973584651947,
"logps/rejected": -82.69353485107422,
"loss": 0.06550046801567078,
"memory(GiB)": 45.64,
"nll_loss": 0.051096200942993164,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3056626617908478,
"rewards/margins": 7.295601844787598,
"rewards/rejected": -6.989939212799072,
"step": 535,
"train_speed(iter/s)": 0.021222
},
{
"epoch": 1.0807876798788185,
"grad_norm": 7.175545692443848,
"learning_rate": 9.46551563268808e-05,
"logits/chosen": -1.1364165544509888,
"logits/rejected": -1.2312272787094116,
"logps/chosen": -3.2798967361450195,
"logps/rejected": -68.39805603027344,
"loss": 0.40154242515563965,
"memory(GiB)": 45.64,
"nll_loss": 0.27947506308555603,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20716847479343414,
"rewards/margins": 5.617040634155273,
"rewards/rejected": -5.409872531890869,
"step": 536,
"train_speed(iter/s)": 0.021222
},
{
"epoch": 1.082807371875789,
"grad_norm": 16.1717472076416,
"learning_rate": 9.432145253306604e-05,
"logits/chosen": -1.1581474542617798,
"logits/rejected": -1.275297999382019,
"logps/chosen": -6.416726112365723,
"logps/rejected": -84.11360931396484,
"loss": 0.6197578310966492,
"memory(GiB)": 45.64,
"nll_loss": 0.6048212647438049,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3198436498641968,
"rewards/margins": 7.643919944763184,
"rewards/rejected": -7.324074745178223,
"step": 537,
"train_speed(iter/s)": 0.021223
},
{
"epoch": 1.0848270638727593,
"grad_norm": 16.336959838867188,
"learning_rate": 9.398781216723331e-05,
"logits/chosen": -1.035546898841858,
"logits/rejected": -1.2581911087036133,
"logps/chosen": -1.4019535779953003,
"logps/rejected": -93.62826538085938,
"loss": 0.3454136550426483,
"memory(GiB)": 45.64,
"nll_loss": 0.23441605269908905,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2636178433895111,
"rewards/margins": 8.16170597076416,
"rewards/rejected": -7.898087501525879,
"step": 538,
"train_speed(iter/s)": 0.021223
},
{
"epoch": 1.08684675586973,
"grad_norm": 4.587718963623047,
"learning_rate": 9.36542389560636e-05,
"logits/chosen": -1.0745295286178589,
"logits/rejected": -1.2483410835266113,
"logps/chosen": -5.092793941497803,
"logps/rejected": -87.74403381347656,
"loss": 0.5541177988052368,
"memory(GiB)": 45.64,
"nll_loss": 0.42148298025131226,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3391857147216797,
"rewards/margins": 7.316706657409668,
"rewards/rejected": -6.977520942687988,
"step": 539,
"train_speed(iter/s)": 0.021223
},
{
"epoch": 1.0888664478667003,
"grad_norm": 2.1240127086639404,
"learning_rate": 9.332073662548784e-05,
"logits/chosen": -1.1243212223052979,
"logits/rejected": -1.193894863128662,
"logps/chosen": -1.587296724319458,
"logps/rejected": -59.78162384033203,
"loss": 0.28339654207229614,
"memory(GiB)": 45.64,
"nll_loss": 0.18274566531181335,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2662951350212097,
"rewards/margins": 5.166958808898926,
"rewards/rejected": -4.900664329528809,
"step": 540,
"train_speed(iter/s)": 0.021224
},
{
"epoch": 1.090886139863671,
"grad_norm": 2.6355695724487305,
"learning_rate": 9.29873089006453e-05,
"logits/chosen": -1.0941351652145386,
"logits/rejected": -1.2066431045532227,
"logps/chosen": -1.4627405405044556,
"logps/rejected": -77.10699462890625,
"loss": 0.2207845151424408,
"memory(GiB)": 45.64,
"nll_loss": 0.13547611236572266,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3999878466129303,
"rewards/margins": 6.711189270019531,
"rewards/rejected": -6.311202049255371,
"step": 541,
"train_speed(iter/s)": 0.021225
},
{
"epoch": 1.0929058318606413,
"grad_norm": 2.05720853805542,
"learning_rate": 9.26539595058418e-05,
"logits/chosen": -1.0910502672195435,
"logits/rejected": -1.2283904552459717,
"logps/chosen": -1.5382826328277588,
"logps/rejected": -76.15080261230469,
"loss": 0.25323227047920227,
"memory(GiB)": 45.64,
"nll_loss": 0.1447850912809372,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3722470700740814,
"rewards/margins": 6.785793304443359,
"rewards/rejected": -6.413545608520508,
"step": 542,
"train_speed(iter/s)": 0.021225
},
{
"epoch": 1.0949255238576117,
"grad_norm": 2.266726493835449,
"learning_rate": 9.23206921645083e-05,
"logits/chosen": -1.0470198392868042,
"logits/rejected": -1.150384545326233,
"logps/chosen": -3.195725679397583,
"logps/rejected": -61.4305534362793,
"loss": 0.293194055557251,
"memory(GiB)": 45.64,
"nll_loss": 0.2274458259344101,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5585137605667114,
"rewards/margins": 5.642398834228516,
"rewards/rejected": -5.083885192871094,
"step": 543,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 1.0969452158545823,
"grad_norm": 2.564605474472046,
"learning_rate": 9.198751059915925e-05,
"logits/chosen": -1.0186107158660889,
"logits/rejected": -1.2122492790222168,
"logps/chosen": -2.0936737060546875,
"logps/rejected": -82.15401458740234,
"loss": 0.34008562564849854,
"memory(GiB)": 45.64,
"nll_loss": 0.2496323138475418,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31812718510627747,
"rewards/margins": 6.999300479888916,
"rewards/rejected": -6.6811723709106445,
"step": 544,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 1.0989649078515527,
"grad_norm": 9.990952491760254,
"learning_rate": 9.165441853135104e-05,
"logits/chosen": -1.1474440097808838,
"logits/rejected": -1.2639394998550415,
"logps/chosen": -1.8011548519134521,
"logps/rejected": -73.41018676757812,
"loss": 0.36625638604164124,
"memory(GiB)": 45.64,
"nll_loss": 0.29132476449012756,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21145863831043243,
"rewards/margins": 6.8196306228637695,
"rewards/rejected": -6.608172416687012,
"step": 545,
"train_speed(iter/s)": 0.021227
},
{
"epoch": 1.100984599848523,
"grad_norm": 2.7831358909606934,
"learning_rate": 9.132141968164026e-05,
"logits/chosen": -1.0405611991882324,
"logits/rejected": -1.2216545343399048,
"logps/chosen": -1.1892681121826172,
"logps/rejected": -94.48490905761719,
"loss": 0.25090837478637695,
"memory(GiB)": 45.64,
"nll_loss": 0.14087605476379395,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3783609867095947,
"rewards/margins": 8.133208274841309,
"rewards/rejected": -7.754847526550293,
"step": 546,
"train_speed(iter/s)": 0.021227
},
{
"epoch": 1.1030042918454936,
"grad_norm": 8.550939559936523,
"learning_rate": 9.098851776954241e-05,
"logits/chosen": -1.0600169897079468,
"logits/rejected": -1.1879816055297852,
"logps/chosen": -2.9978091716766357,
"logps/rejected": -69.18419647216797,
"loss": 0.491380512714386,
"memory(GiB)": 45.64,
"nll_loss": 0.32408130168914795,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21779419481754303,
"rewards/margins": 5.817697048187256,
"rewards/rejected": -5.599903106689453,
"step": 547,
"train_speed(iter/s)": 0.021227
},
{
"epoch": 1.105023983842464,
"grad_norm": 14.694620132446289,
"learning_rate": 9.065571651349015e-05,
"logits/chosen": -1.0587307214736938,
"logits/rejected": -1.1352782249450684,
"logps/chosen": -2.723759174346924,
"logps/rejected": -73.38800048828125,
"loss": 0.3820952773094177,
"memory(GiB)": 45.64,
"nll_loss": 0.28878253698349,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25954926013946533,
"rewards/margins": 6.028653621673584,
"rewards/rejected": -5.769104480743408,
"step": 548,
"train_speed(iter/s)": 0.021228
},
{
"epoch": 1.1070436758394344,
"grad_norm": 3.4368412494659424,
"learning_rate": 9.032301963079191e-05,
"logits/chosen": -1.0471107959747314,
"logits/rejected": -1.216453194618225,
"logps/chosen": -2.2245757579803467,
"logps/rejected": -64.19511413574219,
"loss": 0.2849371135234833,
"memory(GiB)": 45.64,
"nll_loss": 0.2175203114748001,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3077858090400696,
"rewards/margins": 5.670999526977539,
"rewards/rejected": -5.363213539123535,
"step": 549,
"train_speed(iter/s)": 0.021228
},
{
"epoch": 1.109063367836405,
"grad_norm": 2.0185515880584717,
"learning_rate": 8.999043083759017e-05,
"logits/chosen": -1.0703552961349487,
"logits/rejected": -1.2551573514938354,
"logps/chosen": -1.0120265483856201,
"logps/rejected": -85.53215026855469,
"loss": 0.15907928347587585,
"memory(GiB)": 45.64,
"nll_loss": 0.11441606283187866,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2885012924671173,
"rewards/margins": 7.635853290557861,
"rewards/rejected": -7.347352504730225,
"step": 550,
"train_speed(iter/s)": 0.021228
},
{
"epoch": 1.1110830598333754,
"grad_norm": 2.8778460025787354,
"learning_rate": 8.965795384882021e-05,
"logits/chosen": -0.9114001393318176,
"logits/rejected": -1.166597604751587,
"logps/chosen": -1.139864444732666,
"logps/rejected": -100.16082000732422,
"loss": 0.30031049251556396,
"memory(GiB)": 45.64,
"nll_loss": 0.2430577278137207,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.24268564581871033,
"rewards/margins": 8.84631633758545,
"rewards/rejected": -8.603631019592285,
"step": 551,
"train_speed(iter/s)": 0.021214
},
{
"epoch": 1.1131027518303458,
"grad_norm": 2.5478785037994385,
"learning_rate": 8.932559237816839e-05,
"logits/chosen": -0.9818710088729858,
"logits/rejected": -1.225954532623291,
"logps/chosen": -3.4108481407165527,
"logps/rejected": -79.83183288574219,
"loss": 0.4420861601829529,
"memory(GiB)": 45.64,
"nll_loss": 0.3446241617202759,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22779923677444458,
"rewards/margins": 6.333407402038574,
"rewards/rejected": -6.105607509613037,
"step": 552,
"train_speed(iter/s)": 0.021214
},
{
"epoch": 1.1151224438273164,
"grad_norm": 6.415960788726807,
"learning_rate": 8.899335013803084e-05,
"logits/chosen": -1.091843605041504,
"logits/rejected": -1.242721438407898,
"logps/chosen": -1.220659613609314,
"logps/rejected": -61.345306396484375,
"loss": 0.22371630370616913,
"memory(GiB)": 45.64,
"nll_loss": 0.1757785677909851,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.40316012501716614,
"rewards/margins": 5.553282737731934,
"rewards/rejected": -5.150122165679932,
"step": 553,
"train_speed(iter/s)": 0.021215
},
{
"epoch": 1.1171421358242868,
"grad_norm": 1.3796110153198242,
"learning_rate": 8.866123083947182e-05,
"logits/chosen": -1.075179100036621,
"logits/rejected": -1.1752409934997559,
"logps/chosen": -1.5424776077270508,
"logps/rejected": -65.63243103027344,
"loss": 0.23596073687076569,
"memory(GiB)": 45.64,
"nll_loss": 0.18632307648658752,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34452810883522034,
"rewards/margins": 5.910964012145996,
"rewards/rejected": -5.566435813903809,
"step": 554,
"train_speed(iter/s)": 0.021215
},
{
"epoch": 1.1191618278212572,
"grad_norm": 3.3275868892669678,
"learning_rate": 8.832923819218238e-05,
"logits/chosen": -1.001117467880249,
"logits/rejected": -1.1721633672714233,
"logps/chosen": -1.894881010055542,
"logps/rejected": -61.61512756347656,
"loss": 0.35188451409339905,
"memory(GiB)": 45.64,
"nll_loss": 0.3188917636871338,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.12245701998472214,
"rewards/margins": 5.278988838195801,
"rewards/rejected": -5.15653133392334,
"step": 555,
"train_speed(iter/s)": 0.021216
},
{
"epoch": 1.1211815198182278,
"grad_norm": 1.58943510055542,
"learning_rate": 8.799737590443902e-05,
"logits/chosen": -0.9907103776931763,
"logits/rejected": -1.2039836645126343,
"logps/chosen": -3.9374332427978516,
"logps/rejected": -85.5752944946289,
"loss": 0.3835102617740631,
"memory(GiB)": 45.64,
"nll_loss": 0.3536885380744934,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.1798345446586609,
"rewards/margins": 7.102011203765869,
"rewards/rejected": -6.922177314758301,
"step": 556,
"train_speed(iter/s)": 0.021216
},
{
"epoch": 1.1232012118151982,
"grad_norm": 4.0305495262146,
"learning_rate": 8.766564768306207e-05,
"logits/chosen": -1.1515066623687744,
"logits/rejected": -1.214231252670288,
"logps/chosen": -0.7779844999313354,
"logps/rejected": -56.81134796142578,
"loss": 0.1507856547832489,
"memory(GiB)": 45.64,
"nll_loss": 0.0650799572467804,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.30766594409942627,
"rewards/margins": 5.128314971923828,
"rewards/rejected": -4.820648670196533,
"step": 557,
"train_speed(iter/s)": 0.021217
},
{
"epoch": 1.1252209038121685,
"grad_norm": 4.040610313415527,
"learning_rate": 8.733405723337432e-05,
"logits/chosen": -1.0960428714752197,
"logits/rejected": -1.2518525123596191,
"logps/chosen": -0.9766073226928711,
"logps/rejected": -73.12732696533203,
"loss": 0.26937615871429443,
"memory(GiB)": 45.64,
"nll_loss": 0.1882752627134323,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.26189538836479187,
"rewards/margins": 6.15379524230957,
"rewards/rejected": -5.891900062561035,
"step": 558,
"train_speed(iter/s)": 0.021217
},
{
"epoch": 1.1272405958091392,
"grad_norm": 2.961078643798828,
"learning_rate": 8.700260825915976e-05,
"logits/chosen": -0.997047483921051,
"logits/rejected": -1.174019455909729,
"logps/chosen": -1.8312853574752808,
"logps/rejected": -93.381591796875,
"loss": 0.2475411295890808,
"memory(GiB)": 45.64,
"nll_loss": 0.21483805775642395,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3925812244415283,
"rewards/margins": 7.863485336303711,
"rewards/rejected": -7.470904350280762,
"step": 559,
"train_speed(iter/s)": 0.021217
},
{
"epoch": 1.1292602878061095,
"grad_norm": 13.051665306091309,
"learning_rate": 8.667130446262214e-05,
"logits/chosen": -0.8055945634841919,
"logits/rejected": -1.1168835163116455,
"logps/chosen": -1.7664347887039185,
"logps/rejected": -100.53841400146484,
"loss": 0.30384474992752075,
"memory(GiB)": 45.64,
"nll_loss": 0.2042587250471115,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1575130969285965,
"rewards/margins": 8.052501678466797,
"rewards/rejected": -7.894989490509033,
"step": 560,
"train_speed(iter/s)": 0.021217
},
{
"epoch": 1.1312799798030801,
"grad_norm": 2.204517364501953,
"learning_rate": 8.634014954434355e-05,
"logits/chosen": -0.9541032314300537,
"logits/rejected": -1.1428359746932983,
"logps/chosen": -0.8130196928977966,
"logps/rejected": -77.63139343261719,
"loss": 0.11135084927082062,
"memory(GiB)": 45.64,
"nll_loss": 0.06836092472076416,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31184935569763184,
"rewards/margins": 5.629817485809326,
"rewards/rejected": -5.317968368530273,
"step": 561,
"train_speed(iter/s)": 0.021217
},
{
"epoch": 1.1332996718000505,
"grad_norm": 0.7750061750411987,
"learning_rate": 8.600914720324316e-05,
"logits/chosen": -1.127307415008545,
"logits/rejected": -1.2096644639968872,
"logps/chosen": -0.43007510900497437,
"logps/rejected": -60.772300720214844,
"loss": 0.0971565991640091,
"memory(GiB)": 45.64,
"nll_loss": 0.06539256125688553,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.367216557264328,
"rewards/margins": 5.615878105163574,
"rewards/rejected": -5.248661041259766,
"step": 562,
"train_speed(iter/s)": 0.021218
},
{
"epoch": 1.135319363797021,
"grad_norm": 2.891634464263916,
"learning_rate": 8.567830113653597e-05,
"logits/chosen": -1.1409940719604492,
"logits/rejected": -1.1916230916976929,
"logps/chosen": -1.7586002349853516,
"logps/rejected": -63.676971435546875,
"loss": 0.2738097012042999,
"memory(GiB)": 45.64,
"nll_loss": 0.18838034570217133,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5218551158905029,
"rewards/margins": 5.294318675994873,
"rewards/rejected": -4.772463798522949,
"step": 563,
"train_speed(iter/s)": 0.021219
},
{
"epoch": 1.1373390557939915,
"grad_norm": 1.045423150062561,
"learning_rate": 8.534761503969136e-05,
"logits/chosen": -1.0010972023010254,
"logits/rejected": -1.1904897689819336,
"logps/chosen": -1.6170446872711182,
"logps/rejected": -74.0367660522461,
"loss": 0.19317412376403809,
"memory(GiB)": 45.64,
"nll_loss": 0.13384878635406494,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2380320429801941,
"rewards/margins": 5.972710132598877,
"rewards/rejected": -5.734678745269775,
"step": 564,
"train_speed(iter/s)": 0.021219
},
{
"epoch": 1.139358747790962,
"grad_norm": 2.1970374584198,
"learning_rate": 8.501709260639186e-05,
"logits/chosen": -1.0450353622436523,
"logits/rejected": -1.163125991821289,
"logps/chosen": -1.5424336194992065,
"logps/rejected": -73.43540954589844,
"loss": 0.21883387863636017,
"memory(GiB)": 45.64,
"nll_loss": 0.1583956778049469,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.27178311347961426,
"rewards/margins": 5.603139877319336,
"rewards/rejected": -5.331357002258301,
"step": 565,
"train_speed(iter/s)": 0.021219
},
{
"epoch": 1.1413784397879323,
"grad_norm": 2.8700995445251465,
"learning_rate": 8.4686737528492e-05,
"logits/chosen": -1.1470935344696045,
"logits/rejected": -1.2003036737442017,
"logps/chosen": -2.7194712162017822,
"logps/rejected": -73.11854553222656,
"loss": 0.24578091502189636,
"memory(GiB)": 45.64,
"nll_loss": 0.14729218184947968,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.32028070092201233,
"rewards/margins": 6.802761077880859,
"rewards/rejected": -6.482481002807617,
"step": 566,
"train_speed(iter/s)": 0.021219
},
{
"epoch": 1.143398131784903,
"grad_norm": 1.381791114807129,
"learning_rate": 8.435655349597689e-05,
"logits/chosen": -1.0863614082336426,
"logits/rejected": -1.2500827312469482,
"logps/chosen": -0.5668889880180359,
"logps/rejected": -100.23611450195312,
"loss": 0.11013483256101608,
"memory(GiB)": 45.64,
"nll_loss": 0.0759727880358696,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.25675472617149353,
"rewards/margins": 8.975456237792969,
"rewards/rejected": -8.71870231628418,
"step": 567,
"train_speed(iter/s)": 0.02122
},
{
"epoch": 1.1454178237818733,
"grad_norm": 1.6486469507217407,
"learning_rate": 8.40265441969213e-05,
"logits/chosen": -1.108482837677002,
"logits/rejected": -1.2181017398834229,
"logps/chosen": -0.9796234965324402,
"logps/rejected": -72.5177993774414,
"loss": 0.17747226357460022,
"memory(GiB)": 45.64,
"nll_loss": 0.0940045714378357,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4885254204273224,
"rewards/margins": 5.819605350494385,
"rewards/rejected": -5.331079959869385,
"step": 568,
"train_speed(iter/s)": 0.02122
},
{
"epoch": 1.1474375157788437,
"grad_norm": 5.995792865753174,
"learning_rate": 8.369671331744798e-05,
"logits/chosen": -1.119094729423523,
"logits/rejected": -1.2429081201553345,
"logps/chosen": -1.075197696685791,
"logps/rejected": -81.46918487548828,
"loss": 0.21839378774166107,
"memory(GiB)": 45.64,
"nll_loss": 0.15385104715824127,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.457529217004776,
"rewards/margins": 7.371258735656738,
"rewards/rejected": -6.913729667663574,
"step": 569,
"train_speed(iter/s)": 0.021221
},
{
"epoch": 1.1494572077758143,
"grad_norm": 5.149206638336182,
"learning_rate": 8.336706454168701e-05,
"logits/chosen": -1.1530694961547852,
"logits/rejected": -1.29622220993042,
"logps/chosen": -1.0280964374542236,
"logps/rejected": -119.51797485351562,
"loss": 0.20643891394138336,
"memory(GiB)": 45.64,
"nll_loss": 0.08810500800609589,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.43384313583374023,
"rewards/margins": 10.894699096679688,
"rewards/rejected": -10.460856437683105,
"step": 570,
"train_speed(iter/s)": 0.021221
},
{
"epoch": 1.1514768997727847,
"grad_norm": 1.2678836584091187,
"learning_rate": 8.303760155173431e-05,
"logits/chosen": -1.1424627304077148,
"logits/rejected": -1.3004976511001587,
"logps/chosen": -0.5466084480285645,
"logps/rejected": -118.68138122558594,
"loss": 0.12502805888652802,
"memory(GiB)": 45.64,
"nll_loss": 0.1129414513707161,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3263624608516693,
"rewards/margins": 10.448878288269043,
"rewards/rejected": -10.122516632080078,
"step": 571,
"train_speed(iter/s)": 0.021222
},
{
"epoch": 1.153496591769755,
"grad_norm": 1.4974409341812134,
"learning_rate": 8.27083280276107e-05,
"logits/chosen": -1.1443991661071777,
"logits/rejected": -1.3150042295455933,
"logps/chosen": -0.3272748589515686,
"logps/rejected": -139.84246826171875,
"loss": 0.08136013895273209,
"memory(GiB)": 45.64,
"nll_loss": 0.050167154520750046,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4843906760215759,
"rewards/margins": 12.638895034790039,
"rewards/rejected": -12.15450382232666,
"step": 572,
"train_speed(iter/s)": 0.021222
},
{
"epoch": 1.1555162837667257,
"grad_norm": 1.1129848957061768,
"learning_rate": 8.237924764722058e-05,
"logits/chosen": -1.1491975784301758,
"logits/rejected": -1.307010531425476,
"logps/chosen": -1.0129919052124023,
"logps/rejected": -127.45437622070312,
"loss": 0.11947691440582275,
"memory(GiB)": 45.64,
"nll_loss": 0.10945737361907959,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2766776978969574,
"rewards/margins": 11.592185974121094,
"rewards/rejected": -11.315506935119629,
"step": 573,
"train_speed(iter/s)": 0.021222
},
{
"epoch": 1.157535975763696,
"grad_norm": 12.299660682678223,
"learning_rate": 8.20503640863111e-05,
"logits/chosen": -1.2407050132751465,
"logits/rejected": -1.3422547578811646,
"logps/chosen": -0.5153883099555969,
"logps/rejected": -133.4427032470703,
"loss": 0.14274229109287262,
"memory(GiB)": 45.64,
"nll_loss": 0.09612210839986801,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.25790077447891235,
"rewards/margins": 12.522222518920898,
"rewards/rejected": -12.264321327209473,
"step": 574,
"train_speed(iter/s)": 0.021222
},
{
"epoch": 1.1595556677606664,
"grad_norm": 4.597177505493164,
"learning_rate": 8.172168101843099e-05,
"logits/chosen": -1.2469947338104248,
"logits/rejected": -1.3221312761306763,
"logps/chosen": -2.5218143463134766,
"logps/rejected": -64.33858489990234,
"loss": 0.33642834424972534,
"memory(GiB)": 45.64,
"nll_loss": 0.2502836585044861,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3977520167827606,
"rewards/margins": 6.087981700897217,
"rewards/rejected": -5.690229415893555,
"step": 575,
"train_speed(iter/s)": 0.021223
},
{
"epoch": 1.161575359757637,
"grad_norm": 1.4237756729125977,
"learning_rate": 8.139320211488938e-05,
"logits/chosen": -1.20731520652771,
"logits/rejected": -1.3155488967895508,
"logps/chosen": -1.9141697883605957,
"logps/rejected": -84.08015441894531,
"loss": 0.20295384526252747,
"memory(GiB)": 45.64,
"nll_loss": 0.1318996697664261,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3964309096336365,
"rewards/margins": 8.057353973388672,
"rewards/rejected": -7.660923480987549,
"step": 576,
"train_speed(iter/s)": 0.021224
},
{
"epoch": 1.1635950517546074,
"grad_norm": 2.7795519828796387,
"learning_rate": 8.106493104471512e-05,
"logits/chosen": -1.1746073961257935,
"logits/rejected": -1.2740343809127808,
"logps/chosen": -2.3649284839630127,
"logps/rejected": -110.2456283569336,
"loss": 0.2869383990764618,
"memory(GiB)": 45.64,
"nll_loss": 0.21996352076530457,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.37983080744743347,
"rewards/margins": 9.394953727722168,
"rewards/rejected": -9.015122413635254,
"step": 577,
"train_speed(iter/s)": 0.021224
},
{
"epoch": 1.1656147437515778,
"grad_norm": 2.63078236579895,
"learning_rate": 8.073687147461547e-05,
"logits/chosen": -1.1673715114593506,
"logits/rejected": -1.330165147781372,
"logps/chosen": -2.938627004623413,
"logps/rejected": -126.129638671875,
"loss": 0.36669260263442993,
"memory(GiB)": 45.64,
"nll_loss": 0.3255380392074585,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.19922614097595215,
"rewards/margins": 10.992043495178223,
"rewards/rejected": -10.792817115783691,
"step": 578,
"train_speed(iter/s)": 0.021224
},
{
"epoch": 1.1676344357485484,
"grad_norm": 3.1014156341552734,
"learning_rate": 8.04090270689354e-05,
"logits/chosen": -1.2527494430541992,
"logits/rejected": -1.3397026062011719,
"logps/chosen": -2.1539173126220703,
"logps/rejected": -119.85777282714844,
"loss": 0.35629451274871826,
"memory(GiB)": 45.64,
"nll_loss": 0.26880595088005066,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.17089465260505676,
"rewards/margins": 10.79810619354248,
"rewards/rejected": -10.62721061706543,
"step": 579,
"train_speed(iter/s)": 0.021225
},
{
"epoch": 1.1696541277455188,
"grad_norm": 2.183499813079834,
"learning_rate": 8.008140148961641e-05,
"logits/chosen": -1.2131707668304443,
"logits/rejected": -1.3254077434539795,
"logps/chosen": -1.9817386865615845,
"logps/rejected": -97.93504333496094,
"loss": 0.2147722840309143,
"memory(GiB)": 45.64,
"nll_loss": 0.13111397624015808,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3702988922595978,
"rewards/margins": 8.80711555480957,
"rewards/rejected": -8.436817169189453,
"step": 580,
"train_speed(iter/s)": 0.021225
},
{
"epoch": 1.1716738197424892,
"grad_norm": 1.777718186378479,
"learning_rate": 7.975399839615588e-05,
"logits/chosen": -1.2131725549697876,
"logits/rejected": -1.3256409168243408,
"logps/chosen": -1.6898517608642578,
"logps/rejected": -143.40451049804688,
"loss": 0.10389101505279541,
"memory(GiB)": 45.64,
"nll_loss": 0.07294470816850662,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.7127897143363953,
"rewards/margins": 13.449665069580078,
"rewards/rejected": -12.736875534057617,
"step": 581,
"train_speed(iter/s)": 0.021225
},
{
"epoch": 1.1736935117394598,
"grad_norm": 3.9212543964385986,
"learning_rate": 7.942682144556604e-05,
"logits/chosen": -1.1815121173858643,
"logits/rejected": -1.2933522462844849,
"logps/chosen": -1.2875924110412598,
"logps/rejected": -102.97988891601562,
"loss": 0.25881722569465637,
"memory(GiB)": 45.64,
"nll_loss": 0.17525863647460938,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.23393197357654572,
"rewards/margins": 9.580009460449219,
"rewards/rejected": -9.346076011657715,
"step": 582,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 1.1757132037364302,
"grad_norm": 10.820318222045898,
"learning_rate": 7.909987429233317e-05,
"logits/chosen": -1.1671289205551147,
"logits/rejected": -1.2844188213348389,
"logps/chosen": -3.267451047897339,
"logps/rejected": -142.51571655273438,
"loss": 0.3873688876628876,
"memory(GiB)": 45.64,
"nll_loss": 0.2906343936920166,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.45434269309043884,
"rewards/margins": 12.700260162353516,
"rewards/rejected": -12.245917320251465,
"step": 583,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 1.1777328957334006,
"grad_norm": 8.162153244018555,
"learning_rate": 7.877316058837674e-05,
"logits/chosen": -1.0726277828216553,
"logits/rejected": -1.2778667211532593,
"logps/chosen": -2.711777687072754,
"logps/rejected": -147.33900451660156,
"loss": 0.43292930722236633,
"memory(GiB)": 45.64,
"nll_loss": 0.37318992614746094,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31741955876350403,
"rewards/margins": 13.22387981414795,
"rewards/rejected": -12.906461715698242,
"step": 584,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 1.1797525877303712,
"grad_norm": 8.373458862304688,
"learning_rate": 7.844668398300865e-05,
"logits/chosen": -1.1396088600158691,
"logits/rejected": -1.260819435119629,
"logps/chosen": -2.466878890991211,
"logps/rejected": -117.13096618652344,
"loss": 0.3733997344970703,
"memory(GiB)": 45.64,
"nll_loss": 0.3299589157104492,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.13099858164787292,
"rewards/margins": 10.681720733642578,
"rewards/rejected": -10.550722122192383,
"step": 585,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 1.1817722797273416,
"grad_norm": 20.348384857177734,
"learning_rate": 7.812044812289249e-05,
"logits/chosen": -1.2010091543197632,
"logits/rejected": -1.3245834112167358,
"logps/chosen": -3.3453171253204346,
"logps/rejected": -117.00688171386719,
"loss": 0.6515809893608093,
"memory(GiB)": 45.64,
"nll_loss": 0.3382578492164612,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15548963844776154,
"rewards/margins": 10.246532440185547,
"rewards/rejected": -10.091042518615723,
"step": 586,
"train_speed(iter/s)": 0.021226
},
{
"epoch": 1.183791971724312,
"grad_norm": 14.155014991760254,
"learning_rate": 7.779445665200284e-05,
"logits/chosen": -1.1876106262207031,
"logits/rejected": -1.2901134490966797,
"logps/chosen": -3.768019437789917,
"logps/rejected": -83.8199691772461,
"loss": 0.7886047959327698,
"memory(GiB)": 45.64,
"nll_loss": 0.5176796913146973,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16025924682617188,
"rewards/margins": 7.629866600036621,
"rewards/rejected": -7.469607353210449,
"step": 587,
"train_speed(iter/s)": 0.021227
},
{
"epoch": 1.1858116637212825,
"grad_norm": 2.6726722717285156,
"learning_rate": 7.746871321158434e-05,
"logits/chosen": -1.2011233568191528,
"logits/rejected": -1.2838491201400757,
"logps/chosen": -1.551110863685608,
"logps/rejected": -74.54078674316406,
"loss": 0.3482269048690796,
"memory(GiB)": 45.64,
"nll_loss": 0.20897427201271057,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.13612668216228485,
"rewards/margins": 6.496390342712402,
"rewards/rejected": -6.360263824462891,
"step": 588,
"train_speed(iter/s)": 0.021227
},
{
"epoch": 1.187831355718253,
"grad_norm": 11.104055404663086,
"learning_rate": 7.71432214401114e-05,
"logits/chosen": -1.184781551361084,
"logits/rejected": -1.367568850517273,
"logps/chosen": -2.4659273624420166,
"logps/rejected": -158.41024780273438,
"loss": 0.46998411417007446,
"memory(GiB)": 45.64,
"nll_loss": 0.37064406275749207,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14929750561714172,
"rewards/margins": 14.278914451599121,
"rewards/rejected": -14.129616737365723,
"step": 589,
"train_speed(iter/s)": 0.021228
},
{
"epoch": 1.1898510477152233,
"grad_norm": 1.3642657995224,
"learning_rate": 7.681798497324716e-05,
"logits/chosen": -1.1494981050491333,
"logits/rejected": -1.2755074501037598,
"logps/chosen": -3.920079231262207,
"logps/rejected": -99.15157318115234,
"loss": 0.1694917380809784,
"memory(GiB)": 45.64,
"nll_loss": 0.1302870661020279,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6689797043800354,
"rewards/margins": 8.986592292785645,
"rewards/rejected": -8.317612648010254,
"step": 590,
"train_speed(iter/s)": 0.021228
},
{
"epoch": 1.191870739712194,
"grad_norm": 2.9878756999969482,
"learning_rate": 7.649300744380328e-05,
"logits/chosen": -1.2234166860580444,
"logits/rejected": -1.3413805961608887,
"logps/chosen": -3.245425224304199,
"logps/rejected": -97.82754516601562,
"loss": 0.6991743445396423,
"memory(GiB)": 45.64,
"nll_loss": 0.5142159461975098,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.04035697877407074,
"rewards/margins": 8.96734619140625,
"rewards/rejected": -8.926989555358887,
"step": 591,
"train_speed(iter/s)": 0.021228
},
{
"epoch": 1.1938904317091643,
"grad_norm": 3.8199944496154785,
"learning_rate": 7.616829248169891e-05,
"logits/chosen": -1.168949842453003,
"logits/rejected": -1.2326381206512451,
"logps/chosen": -2.8712589740753174,
"logps/rejected": -63.083431243896484,
"loss": 0.4011121094226837,
"memory(GiB)": 45.64,
"nll_loss": 0.2862622141838074,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.291637659072876,
"rewards/margins": 5.633680820465088,
"rewards/rejected": -5.342043399810791,
"step": 592,
"train_speed(iter/s)": 0.021228
},
{
"epoch": 1.1959101237061347,
"grad_norm": 2.4625227451324463,
"learning_rate": 7.584384371392055e-05,
"logits/chosen": -1.2142324447631836,
"logits/rejected": -1.2614374160766602,
"logps/chosen": -1.5779057741165161,
"logps/rejected": -86.51065826416016,
"loss": 0.1223965585231781,
"memory(GiB)": 45.64,
"nll_loss": 0.09837526828050613,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.9265052676200867,
"rewards/margins": 8.553476333618164,
"rewards/rejected": -7.62697172164917,
"step": 593,
"train_speed(iter/s)": 0.021229
},
{
"epoch": 1.1979298157031053,
"grad_norm": 3.092069149017334,
"learning_rate": 7.55196647644814e-05,
"logits/chosen": -1.1460374593734741,
"logits/rejected": -1.325160264968872,
"logps/chosen": -0.844829261302948,
"logps/rejected": -130.2720184326172,
"loss": 0.1258152425289154,
"memory(GiB)": 45.64,
"nll_loss": 0.09725081920623779,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.22555547952651978,
"rewards/margins": 11.706364631652832,
"rewards/rejected": -11.480809211730957,
"step": 594,
"train_speed(iter/s)": 0.021229
},
{
"epoch": 1.1999495077000757,
"grad_norm": 4.890739440917969,
"learning_rate": 7.519575925438067e-05,
"logits/chosen": -1.1363235712051392,
"logits/rejected": -1.3047442436218262,
"logps/chosen": -3.450829267501831,
"logps/rejected": -122.64608001708984,
"loss": 0.40785038471221924,
"memory(GiB)": 45.64,
"nll_loss": 0.2815420627593994,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.30323055386543274,
"rewards/margins": 10.626569747924805,
"rewards/rejected": -10.323339462280273,
"step": 595,
"train_speed(iter/s)": 0.021229
},
{
"epoch": 1.201969199697046,
"grad_norm": 9.498205184936523,
"learning_rate": 7.487213080156355e-05,
"logits/chosen": -1.2033909559249878,
"logits/rejected": -1.2762019634246826,
"logps/chosen": -1.286055326461792,
"logps/rejected": -79.14070129394531,
"loss": 0.24982167780399323,
"memory(GiB)": 45.64,
"nll_loss": 0.14821632206439972,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2594597637653351,
"rewards/margins": 7.015608787536621,
"rewards/rejected": -6.756147861480713,
"step": 596,
"train_speed(iter/s)": 0.02123
},
{
"epoch": 1.2039888916940167,
"grad_norm": 5.124003887176514,
"learning_rate": 7.454878302088039e-05,
"logits/chosen": -1.1855096817016602,
"logits/rejected": -1.2832536697387695,
"logps/chosen": -2.1323423385620117,
"logps/rejected": -77.67525482177734,
"loss": 0.3236369490623474,
"memory(GiB)": 45.64,
"nll_loss": 0.22611530125141144,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2844330668449402,
"rewards/margins": 6.800313472747803,
"rewards/rejected": -6.515880584716797,
"step": 597,
"train_speed(iter/s)": 0.02123
},
{
"epoch": 1.206008583690987,
"grad_norm": 7.811437606811523,
"learning_rate": 7.422571952404663e-05,
"logits/chosen": -1.1619443893432617,
"logits/rejected": -1.2858407497406006,
"logps/chosen": -3.6687519550323486,
"logps/rejected": -89.48348236083984,
"loss": 0.6337468028068542,
"memory(GiB)": 45.64,
"nll_loss": 0.430719256401062,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.09281295537948608,
"rewards/margins": 7.673408508300781,
"rewards/rejected": -7.58059549331665,
"step": 598,
"train_speed(iter/s)": 0.021231
},
{
"epoch": 1.2080282756879577,
"grad_norm": 6.1173577308654785,
"learning_rate": 7.390294391960217e-05,
"logits/chosen": -1.2435667514801025,
"logits/rejected": -1.3407572507858276,
"logps/chosen": -0.851167619228363,
"logps/rejected": -90.95581817626953,
"loss": 0.1322077065706253,
"memory(GiB)": 45.64,
"nll_loss": 0.07706882804632187,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3039519786834717,
"rewards/margins": 8.613190650939941,
"rewards/rejected": -8.309237480163574,
"step": 599,
"train_speed(iter/s)": 0.021231
},
{
"epoch": 1.210047967684928,
"grad_norm": 1.1325865983963013,
"learning_rate": 7.358045981287141e-05,
"logits/chosen": -1.1153496503829956,
"logits/rejected": -1.2983583211898804,
"logps/chosen": -0.8740055561065674,
"logps/rejected": -100.239990234375,
"loss": 0.1091877669095993,
"memory(GiB)": 45.64,
"nll_loss": 0.0765417069196701,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.24975469708442688,
"rewards/margins": 8.55569076538086,
"rewards/rejected": -8.305935859680176,
"step": 600,
"train_speed(iter/s)": 0.021231
},
{
"epoch": 1.210047967684928,
"eval_logits/chosen": -1.1828652620315552,
"eval_logits/rejected": -1.3658164739608765,
"eval_logps/chosen": -1.8309376239776611,
"eval_logps/rejected": -125.0011215209961,
"eval_loss": 0.24665305018424988,
"eval_nll_loss": 0.17694206535816193,
"eval_rewards/accuracies": 0.9750000238418579,
"eval_rewards/chosen": 0.26265937089920044,
"eval_rewards/margins": 11.061813354492188,
"eval_rewards/rejected": -10.799153327941895,
"eval_runtime": 92.2944,
"eval_samples_per_second": 0.867,
"eval_steps_per_second": 0.433,
"step": 600
}
],
"logging_steps": 1,
"max_steps": 990,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.7337917669638144e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}