PEFT
Safetensors
task05rd2-50 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
a97dafa verified
Raw
History Blame Contribute Delete
32.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.2882882882882883,
"eval_steps": 300,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.005765765765765766,
"grad_norm": 2.1474921703338623,
"learning_rate": 7.692307692307694e-06,
"logits/chosen": -0.4285973310470581,
"logits/rejected": -0.721319854259491,
"logps/chosen": -2.468954086303711,
"logps/rejected": -59.87730407714844,
"loss": 0.22946561872959137,
"memory(GiB)": 30.65,
"nll_loss": 0.13756254315376282,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.23724405467510223,
"rewards/margins": 3.9806408882141113,
"rewards/rejected": -3.743396759033203,
"step": 1,
"train_speed(iter/s)": 0.01022
},
{
"epoch": 0.011531531531531532,
"grad_norm": 2.328110456466675,
"learning_rate": 1.5384615384615387e-05,
"logits/chosen": -0.3982561528682709,
"logits/rejected": -0.7214521169662476,
"logps/chosen": -3.335645914077759,
"logps/rejected": -60.79209899902344,
"loss": 0.3770241439342499,
"memory(GiB)": 30.65,
"nll_loss": 0.23075783252716064,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.10687967389822006,
"rewards/margins": 3.9392333030700684,
"rewards/rejected": -3.832353353500366,
"step": 2,
"train_speed(iter/s)": 0.010488
},
{
"epoch": 0.017297297297297298,
"grad_norm": 14.568985939025879,
"learning_rate": 2.307692307692308e-05,
"logits/chosen": -0.43175598978996277,
"logits/rejected": -0.6921666264533997,
"logps/chosen": -5.190546035766602,
"logps/rejected": -51.33646011352539,
"loss": 0.9886025786399841,
"memory(GiB)": 34.1,
"nll_loss": 0.6371194124221802,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.034887176007032394,
"rewards/margins": 3.2021734714508057,
"rewards/rejected": -3.237060785293579,
"step": 3,
"train_speed(iter/s)": 0.010581
},
{
"epoch": 0.023063063063063063,
"grad_norm": 13.817249298095703,
"learning_rate": 3.0769230769230774e-05,
"logits/chosen": -0.4616771340370178,
"logits/rejected": -0.6264235973358154,
"logps/chosen": -3.2552552223205566,
"logps/rejected": -51.25586700439453,
"loss": 0.5021163821220398,
"memory(GiB)": 37.58,
"nll_loss": 0.26375898718833923,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06816040724515915,
"rewards/margins": 3.5297036170959473,
"rewards/rejected": -3.461543083190918,
"step": 4,
"train_speed(iter/s)": 0.010625
},
{
"epoch": 0.02882882882882883,
"grad_norm": 2.363553524017334,
"learning_rate": 3.846153846153846e-05,
"logits/chosen": -0.48805952072143555,
"logits/rejected": -0.7040677070617676,
"logps/chosen": -6.89398717880249,
"logps/rejected": -59.37879943847656,
"loss": 0.39657193422317505,
"memory(GiB)": 37.58,
"nll_loss": 0.2818652391433716,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1999940723180771,
"rewards/margins": 4.230030059814453,
"rewards/rejected": -4.030035495758057,
"step": 5,
"train_speed(iter/s)": 0.010659
},
{
"epoch": 0.034594594594594595,
"grad_norm": 4.551424026489258,
"learning_rate": 4.615384615384616e-05,
"logits/chosen": -0.39471542835235596,
"logits/rejected": -0.6508359909057617,
"logps/chosen": -6.633285999298096,
"logps/rejected": -58.268653869628906,
"loss": 0.5636770129203796,
"memory(GiB)": 41.24,
"nll_loss": 0.41472452878952026,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1396198272705078,
"rewards/margins": 3.7723348140716553,
"rewards/rejected": -3.6327152252197266,
"step": 6,
"train_speed(iter/s)": 0.010667
},
{
"epoch": 0.04036036036036036,
"grad_norm": 4.302145481109619,
"learning_rate": 5.384615384615385e-05,
"logits/chosen": -0.42404329776763916,
"logits/rejected": -0.7084805369377136,
"logps/chosen": -4.09792947769165,
"logps/rejected": -69.69088745117188,
"loss": 0.5202179551124573,
"memory(GiB)": 41.24,
"nll_loss": 0.3875095546245575,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.018997177481651306,
"rewards/margins": 5.0437703132629395,
"rewards/rejected": -5.062767505645752,
"step": 7,
"train_speed(iter/s)": 0.010685
},
{
"epoch": 0.04612612612612613,
"grad_norm": 4.475785255432129,
"learning_rate": 6.153846153846155e-05,
"logits/chosen": -0.4411894977092743,
"logits/rejected": -0.6594015955924988,
"logps/chosen": -6.067828178405762,
"logps/rejected": -52.161441802978516,
"loss": 0.8079419136047363,
"memory(GiB)": 41.24,
"nll_loss": 0.5527109503746033,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13843362033367157,
"rewards/margins": 3.638244390487671,
"rewards/rejected": -3.4998104572296143,
"step": 8,
"train_speed(iter/s)": 0.010699
},
{
"epoch": 0.05189189189189189,
"grad_norm": 7.412286281585693,
"learning_rate": 6.923076923076924e-05,
"logits/chosen": -0.4308490753173828,
"logits/rejected": -0.6868806481361389,
"logps/chosen": -4.5601372718811035,
"logps/rejected": -75.88018798828125,
"loss": 0.3704576790332794,
"memory(GiB)": 41.24,
"nll_loss": 0.23506566882133484,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1938612163066864,
"rewards/margins": 5.914104461669922,
"rewards/rejected": -5.720243453979492,
"step": 9,
"train_speed(iter/s)": 0.010708
},
{
"epoch": 0.05765765765765766,
"grad_norm": 2.0841763019561768,
"learning_rate": 7.692307692307693e-05,
"logits/chosen": -0.4546598792076111,
"logits/rejected": -0.7517622113227844,
"logps/chosen": -1.471292495727539,
"logps/rejected": -70.88200378417969,
"loss": 0.2737431526184082,
"memory(GiB)": 41.24,
"nll_loss": 0.14067727327346802,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13278257846832275,
"rewards/margins": 5.628582000732422,
"rewards/rejected": -5.495799541473389,
"step": 10,
"train_speed(iter/s)": 0.010721
},
{
"epoch": 0.06342342342342343,
"grad_norm": 5.912591457366943,
"learning_rate": 8.461538461538461e-05,
"logits/chosen": -0.4128813147544861,
"logits/rejected": -0.5927000045776367,
"logps/chosen": -7.319942474365234,
"logps/rejected": -61.27806091308594,
"loss": 0.5680095553398132,
"memory(GiB)": 41.24,
"nll_loss": 0.3753523826599121,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.07616602629423141,
"rewards/margins": 4.830938816070557,
"rewards/rejected": -4.754772663116455,
"step": 11,
"train_speed(iter/s)": 0.010727
},
{
"epoch": 0.06918918918918919,
"grad_norm": 2.5374209880828857,
"learning_rate": 9.230769230769232e-05,
"logits/chosen": -0.349031925201416,
"logits/rejected": -0.6373917460441589,
"logps/chosen": -4.199922561645508,
"logps/rejected": -72.83607482910156,
"loss": 0.34027042984962463,
"memory(GiB)": 41.24,
"nll_loss": 0.22808796167373657,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.20608201622962952,
"rewards/margins": 5.424815654754639,
"rewards/rejected": -5.218733787536621,
"step": 12,
"train_speed(iter/s)": 0.010728
},
{
"epoch": 0.07495495495495495,
"grad_norm": 2.7130517959594727,
"learning_rate": 0.0001,
"logits/chosen": -0.3631379306316376,
"logits/rejected": -0.6601940989494324,
"logps/chosen": -3.3938565254211426,
"logps/rejected": -65.2313232421875,
"loss": 0.4514213800430298,
"memory(GiB)": 41.24,
"nll_loss": 0.30333614349365234,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.06806281208992004,
"rewards/margins": 4.726724624633789,
"rewards/rejected": -4.658661365509033,
"step": 13,
"train_speed(iter/s)": 0.010733
},
{
"epoch": 0.08072072072072072,
"grad_norm": 1.5474798679351807,
"learning_rate": 0.0001076923076923077,
"logits/chosen": -0.4096493124961853,
"logits/rejected": -0.6515597105026245,
"logps/chosen": -2.300206184387207,
"logps/rejected": -57.26811218261719,
"loss": 0.3060320019721985,
"memory(GiB)": 41.24,
"nll_loss": 0.1727571338415146,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08898697793483734,
"rewards/margins": 4.1406354904174805,
"rewards/rejected": -4.0516486167907715,
"step": 14,
"train_speed(iter/s)": 0.010737
},
{
"epoch": 0.08648648648648649,
"grad_norm": 1.628075361251831,
"learning_rate": 0.00011538461538461538,
"logits/chosen": -0.4402551054954529,
"logits/rejected": -0.6672070622444153,
"logps/chosen": -2.9995224475860596,
"logps/rejected": -53.87057113647461,
"loss": 0.3575773239135742,
"memory(GiB)": 41.24,
"nll_loss": 0.2217392474412918,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20550209283828735,
"rewards/margins": 3.6874935626983643,
"rewards/rejected": -3.4819912910461426,
"step": 15,
"train_speed(iter/s)": 0.010742
},
{
"epoch": 0.09225225225225225,
"grad_norm": 1.838375449180603,
"learning_rate": 0.0001230769230769231,
"logits/chosen": -0.3547935485839844,
"logits/rejected": -0.6626885533332825,
"logps/chosen": -4.558413982391357,
"logps/rejected": -64.36922454833984,
"loss": 0.45015937089920044,
"memory(GiB)": 41.24,
"nll_loss": 0.3128659129142761,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.14241908490657806,
"rewards/margins": 4.83186149597168,
"rewards/rejected": -4.689442157745361,
"step": 16,
"train_speed(iter/s)": 0.010745
},
{
"epoch": 0.09801801801801802,
"grad_norm": 3.119417667388916,
"learning_rate": 0.00013076923076923077,
"logits/chosen": -0.3334687352180481,
"logits/rejected": -0.6293997168540955,
"logps/chosen": -5.949204444885254,
"logps/rejected": -74.25395965576172,
"loss": 0.6850419044494629,
"memory(GiB)": 41.24,
"nll_loss": 0.5004001259803772,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.07516612857580185,
"rewards/margins": 4.788809776306152,
"rewards/rejected": -4.713644027709961,
"step": 17,
"train_speed(iter/s)": 0.010741
},
{
"epoch": 0.10378378378378378,
"grad_norm": 1.6356091499328613,
"learning_rate": 0.00013846153846153847,
"logits/chosen": -0.3526935875415802,
"logits/rejected": -0.6357190608978271,
"logps/chosen": -2.911073923110962,
"logps/rejected": -66.46131896972656,
"loss": 0.32070592045783997,
"memory(GiB)": 41.24,
"nll_loss": 0.18397927284240723,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.09694083034992218,
"rewards/margins": 5.153117656707764,
"rewards/rejected": -5.056177139282227,
"step": 18,
"train_speed(iter/s)": 0.010741
},
{
"epoch": 0.10954954954954955,
"grad_norm": 2.7403504848480225,
"learning_rate": 0.00014615384615384615,
"logits/chosen": -0.3763662278652191,
"logits/rejected": -0.586420476436615,
"logps/chosen": -4.417596340179443,
"logps/rejected": -58.99639892578125,
"loss": 0.4634058177471161,
"memory(GiB)": 41.24,
"nll_loss": 0.28715017437934875,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1435782015323639,
"rewards/margins": 4.609218120574951,
"rewards/rejected": -4.465640068054199,
"step": 19,
"train_speed(iter/s)": 0.010743
},
{
"epoch": 0.11531531531531532,
"grad_norm": 1.982851266860962,
"learning_rate": 0.00015384615384615385,
"logits/chosen": -0.3701193332672119,
"logits/rejected": -0.6088087558746338,
"logps/chosen": -4.619842529296875,
"logps/rejected": -68.1020278930664,
"loss": 0.4344192445278168,
"memory(GiB)": 41.24,
"nll_loss": 0.26591166853904724,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10610304027795792,
"rewards/margins": 5.044137954711914,
"rewards/rejected": -4.938034534454346,
"step": 20,
"train_speed(iter/s)": 0.010745
},
{
"epoch": 0.12108108108108108,
"grad_norm": 3.175961494445801,
"learning_rate": 0.00016153846153846155,
"logits/chosen": -0.40009674429893494,
"logits/rejected": -0.642030656337738,
"logps/chosen": -3.357761859893799,
"logps/rejected": -65.21231842041016,
"loss": 0.40142354369163513,
"memory(GiB)": 41.24,
"nll_loss": 0.2889588177204132,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1323939859867096,
"rewards/margins": 5.234187602996826,
"rewards/rejected": -5.1017937660217285,
"step": 21,
"train_speed(iter/s)": 0.010748
},
{
"epoch": 0.12684684684684686,
"grad_norm": 1.9400721788406372,
"learning_rate": 0.00016923076923076923,
"logits/chosen": -0.3025435209274292,
"logits/rejected": -0.6950021386146545,
"logps/chosen": -2.492130994796753,
"logps/rejected": -107.03312683105469,
"loss": 0.2920421361923218,
"memory(GiB)": 41.24,
"nll_loss": 0.19772115349769592,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.19073158502578735,
"rewards/margins": 8.599780082702637,
"rewards/rejected": -8.409048080444336,
"step": 22,
"train_speed(iter/s)": 0.010746
},
{
"epoch": 0.13261261261261262,
"grad_norm": 1.3099267482757568,
"learning_rate": 0.00017692307692307693,
"logits/chosen": -0.36498135328292847,
"logits/rejected": -0.6359634399414062,
"logps/chosen": -2.421377658843994,
"logps/rejected": -74.05368041992188,
"loss": 0.20869436860084534,
"memory(GiB)": 41.24,
"nll_loss": 0.11023169010877609,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.18500684201717377,
"rewards/margins": 5.958514213562012,
"rewards/rejected": -5.773507118225098,
"step": 23,
"train_speed(iter/s)": 0.010747
},
{
"epoch": 0.13837837837837838,
"grad_norm": 1.9334064722061157,
"learning_rate": 0.00018461538461538463,
"logits/chosen": -0.45037421584129333,
"logits/rejected": -0.7719848155975342,
"logps/chosen": -2.6665430068969727,
"logps/rejected": -94.5350570678711,
"loss": 0.3057625889778137,
"memory(GiB)": 41.24,
"nll_loss": 0.2374470978975296,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.09573014080524445,
"rewards/margins": 8.040020942687988,
"rewards/rejected": -7.944291114807129,
"step": 24,
"train_speed(iter/s)": 0.010749
},
{
"epoch": 0.14414414414414414,
"grad_norm": 7.789314270019531,
"learning_rate": 0.00019230769230769233,
"logits/chosen": -0.3473276197910309,
"logits/rejected": -0.6793957352638245,
"logps/chosen": -4.235269069671631,
"logps/rejected": -109.01844024658203,
"loss": 0.42337244749069214,
"memory(GiB)": 41.24,
"nll_loss": 0.21255403757095337,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.009569963440299034,
"rewards/margins": 8.769816398620605,
"rewards/rejected": -8.760246276855469,
"step": 25,
"train_speed(iter/s)": 0.010747
},
{
"epoch": 0.1499099099099099,
"grad_norm": 1.970948338508606,
"learning_rate": 0.0002,
"logits/chosen": -0.40258127450942993,
"logits/rejected": -0.7479668259620667,
"logps/chosen": -2.0013341903686523,
"logps/rejected": -85.51154327392578,
"loss": 0.4197818636894226,
"memory(GiB)": 41.24,
"nll_loss": 0.2574591636657715,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.16396881639957428,
"rewards/margins": 7.033238410949707,
"rewards/rejected": -6.869269847869873,
"step": 26,
"train_speed(iter/s)": 0.010746
},
{
"epoch": 0.15567567567567567,
"grad_norm": 11.3534574508667,
"learning_rate": 0.00019999796963348897,
"logits/chosen": -0.5246711373329163,
"logits/rejected": -0.7294141054153442,
"logps/chosen": -11.85606575012207,
"logps/rejected": -76.03211975097656,
"loss": 0.8875234127044678,
"memory(GiB)": 41.24,
"nll_loss": 0.575400710105896,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.2269383817911148,
"rewards/margins": 5.498793125152588,
"rewards/rejected": -5.725731372833252,
"step": 27,
"train_speed(iter/s)": 0.010747
},
{
"epoch": 0.16144144144144143,
"grad_norm": 2.0314371585845947,
"learning_rate": 0.00019999187861640362,
"logits/chosen": -0.5284671187400818,
"logits/rejected": -0.7846834063529968,
"logps/chosen": -4.434022426605225,
"logps/rejected": -87.89623260498047,
"loss": 0.3868662416934967,
"memory(GiB)": 41.24,
"nll_loss": 0.30320096015930176,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.07812386751174927,
"rewards/margins": 7.374299049377441,
"rewards/rejected": -7.296175479888916,
"step": 28,
"train_speed(iter/s)": 0.010748
},
{
"epoch": 0.16720720720720722,
"grad_norm": 6.089433193206787,
"learning_rate": 0.0001999817271960839,
"logits/chosen": -0.4792092442512512,
"logits/rejected": -0.7371792793273926,
"logps/chosen": -3.6791412830352783,
"logps/rejected": -80.48262023925781,
"loss": 0.34335166215896606,
"memory(GiB)": 41.24,
"nll_loss": 0.22308313846588135,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.049518827348947525,
"rewards/margins": 6.395692825317383,
"rewards/rejected": -6.445211410522461,
"step": 29,
"train_speed(iter/s)": 0.010751
},
{
"epoch": 0.17297297297297298,
"grad_norm": 1.8896535634994507,
"learning_rate": 0.00019996751578475186,
"logits/chosen": -0.44468259811401367,
"logits/rejected": -0.7023504972457886,
"logps/chosen": -3.048004388809204,
"logps/rejected": -80.6348648071289,
"loss": 0.30949145555496216,
"memory(GiB)": 41.24,
"nll_loss": 0.1800393909215927,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.15738406777381897,
"rewards/margins": 5.8682780265808105,
"rewards/rejected": -5.710893630981445,
"step": 30,
"train_speed(iter/s)": 0.010749
},
{
"epoch": 0.17873873873873874,
"grad_norm": 2.7516067028045654,
"learning_rate": 0.00019994924495949504,
"logits/chosen": -0.4754641652107239,
"logits/rejected": -0.7408227920532227,
"logps/chosen": -5.943354606628418,
"logps/rejected": -79.13115692138672,
"loss": 0.6435320973396301,
"memory(GiB)": 41.24,
"nll_loss": 0.4586246609687805,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0629303902387619,
"rewards/margins": 6.110820293426514,
"rewards/rejected": -6.0478901863098145,
"step": 31,
"train_speed(iter/s)": 0.01075
},
{
"epoch": 0.1845045045045045,
"grad_norm": 5.854465007781982,
"learning_rate": 0.00019992691546224278,
"logits/chosen": -0.45127877593040466,
"logits/rejected": -0.7568551898002625,
"logps/chosen": -2.736678123474121,
"logps/rejected": -66.9885025024414,
"loss": 0.3652667701244354,
"memory(GiB)": 41.24,
"nll_loss": 0.16899552941322327,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.050895966589450836,
"rewards/margins": 4.933393478393555,
"rewards/rejected": -4.882497310638428,
"step": 32,
"train_speed(iter/s)": 0.01075
},
{
"epoch": 0.19027027027027027,
"grad_norm": 1.3124663829803467,
"learning_rate": 0.00019990052819973642,
"logits/chosen": -0.3465266227722168,
"logits/rejected": -0.6685288548469543,
"logps/chosen": -3.301164388656616,
"logps/rejected": -85.9378662109375,
"loss": 0.3046538233757019,
"memory(GiB)": 41.24,
"nll_loss": 0.1670866757631302,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.17874348163604736,
"rewards/margins": 6.709518909454346,
"rewards/rejected": -6.530775547027588,
"step": 33,
"train_speed(iter/s)": 0.010748
},
{
"epoch": 0.19603603603603603,
"grad_norm": 2.341381549835205,
"learning_rate": 0.00019987008424349225,
"logits/chosen": -0.38037875294685364,
"logits/rejected": -0.699614405632019,
"logps/chosen": -1.5970546007156372,
"logps/rejected": -74.28025817871094,
"loss": 0.20820346474647522,
"memory(GiB)": 41.24,
"nll_loss": 0.10679290443658829,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.11616384983062744,
"rewards/margins": 5.825808048248291,
"rewards/rejected": -5.709644794464111,
"step": 34,
"train_speed(iter/s)": 0.010749
},
{
"epoch": 0.2018018018018018,
"grad_norm": 5.144662380218506,
"learning_rate": 0.00019983558482975799,
"logits/chosen": -0.46614986658096313,
"logits/rejected": -0.6599275469779968,
"logps/chosen": -5.982501983642578,
"logps/rejected": -67.7139892578125,
"loss": 0.5879941582679749,
"memory(GiB)": 41.24,
"nll_loss": 0.4303022027015686,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16055577993392944,
"rewards/margins": 5.052016258239746,
"rewards/rejected": -4.89146089553833,
"step": 35,
"train_speed(iter/s)": 0.010749
},
{
"epoch": 0.20756756756756756,
"grad_norm": 1.990370273590088,
"learning_rate": 0.00019979703135946278,
"logits/chosen": -0.4655105471611023,
"logits/rejected": -0.6668959856033325,
"logps/chosen": -4.062808036804199,
"logps/rejected": -72.87210845947266,
"loss": 0.4453062415122986,
"memory(GiB)": 41.24,
"nll_loss": 0.25426411628723145,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09591292589902878,
"rewards/margins": 5.528655052185059,
"rewards/rejected": -5.432741641998291,
"step": 36,
"train_speed(iter/s)": 0.010749
},
{
"epoch": 0.21333333333333335,
"grad_norm": 2.0748369693756104,
"learning_rate": 0.00019975442539816012,
"logits/chosen": -0.4139191210269928,
"logits/rejected": -0.7536109685897827,
"logps/chosen": -5.956673622131348,
"logps/rejected": -66.99488830566406,
"loss": 0.5514004826545715,
"memory(GiB)": 41.24,
"nll_loss": 0.3969358503818512,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.33245787024497986,
"rewards/margins": 5.0754570960998535,
"rewards/rejected": -4.742999076843262,
"step": 37,
"train_speed(iter/s)": 0.01075
},
{
"epoch": 0.2190990990990991,
"grad_norm": 1.6668081283569336,
"learning_rate": 0.0001997077686759643,
"logits/chosen": -0.42306363582611084,
"logits/rejected": -0.6915761232376099,
"logps/chosen": -3.814265727996826,
"logps/rejected": -82.30941772460938,
"loss": 0.3710038363933563,
"memory(GiB)": 41.24,
"nll_loss": 0.22380009293556213,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.06087161600589752,
"rewards/margins": 6.076653957366943,
"rewards/rejected": -6.015782356262207,
"step": 38,
"train_speed(iter/s)": 0.01075
},
{
"epoch": 0.22486486486486487,
"grad_norm": 13.827637672424316,
"learning_rate": 0.00019965706308748028,
"logits/chosen": -0.49769100546836853,
"logits/rejected": -0.7370949983596802,
"logps/chosen": -3.956310272216797,
"logps/rejected": -79.41323852539062,
"loss": 0.6633445620536804,
"memory(GiB)": 41.24,
"nll_loss": 0.3870386779308319,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.13494591414928436,
"rewards/margins": 6.147372722625732,
"rewards/rejected": -6.282319068908691,
"step": 39,
"train_speed(iter/s)": 0.010751
},
{
"epoch": 0.23063063063063063,
"grad_norm": 2.19854474067688,
"learning_rate": 0.0001996023106917267,
"logits/chosen": -0.44343504309654236,
"logits/rejected": -0.6730125546455383,
"logps/chosen": -2.9238576889038086,
"logps/rejected": -77.40494537353516,
"loss": 0.3453696668148041,
"memory(GiB)": 41.24,
"nll_loss": 0.19069285690784454,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14595907926559448,
"rewards/margins": 6.002254486083984,
"rewards/rejected": -5.856295108795166,
"step": 40,
"train_speed(iter/s)": 0.010752
},
{
"epoch": 0.2363963963963964,
"grad_norm": 6.0794596672058105,
"learning_rate": 0.00019954351371205203,
"logits/chosen": -0.47579658031463623,
"logits/rejected": -0.6826990842819214,
"logps/chosen": -5.335310935974121,
"logps/rejected": -75.78384399414062,
"loss": 0.575509250164032,
"memory(GiB)": 41.24,
"nll_loss": 0.4477939307689667,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2103371024131775,
"rewards/margins": 6.012211322784424,
"rewards/rejected": -5.801875114440918,
"step": 41,
"train_speed(iter/s)": 0.010754
},
{
"epoch": 0.24216216216216216,
"grad_norm": 1.4152264595031738,
"learning_rate": 0.00019948067453604473,
"logits/chosen": -0.49620914459228516,
"logits/rejected": -0.7446714043617249,
"logps/chosen": -3.284031867980957,
"logps/rejected": -77.9183349609375,
"loss": 0.29828324913978577,
"memory(GiB)": 41.24,
"nll_loss": 0.21160344779491425,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18678154051303864,
"rewards/margins": 6.247434616088867,
"rewards/rejected": -6.060652732849121,
"step": 42,
"train_speed(iter/s)": 0.010755
},
{
"epoch": 0.24792792792792792,
"grad_norm": 2.9591963291168213,
"learning_rate": 0.00019941379571543596,
"logits/chosen": -0.4777877628803253,
"logits/rejected": -0.6974171996116638,
"logps/chosen": -2.9466118812561035,
"logps/rejected": -66.2719497680664,
"loss": 0.35521066188812256,
"memory(GiB)": 41.24,
"nll_loss": 0.22793087363243103,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27246373891830444,
"rewards/margins": 5.403186798095703,
"rewards/rejected": -5.130722999572754,
"step": 43,
"train_speed(iter/s)": 0.010756
},
{
"epoch": 0.2536936936936937,
"grad_norm": 4.199843883514404,
"learning_rate": 0.00019934287996599607,
"logits/chosen": -0.4372207522392273,
"logits/rejected": -0.700534462928772,
"logps/chosen": -3.31451416015625,
"logps/rejected": -70.0909194946289,
"loss": 0.3793654143810272,
"memory(GiB)": 41.24,
"nll_loss": 0.20433279871940613,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.059201404452323914,
"rewards/margins": 4.912087917327881,
"rewards/rejected": -4.852885723114014,
"step": 44,
"train_speed(iter/s)": 0.010756
},
{
"epoch": 0.2594594594594595,
"grad_norm": 0.7397028803825378,
"learning_rate": 0.00019926793016742435,
"logits/chosen": -0.42062634229660034,
"logits/rejected": -0.7593384981155396,
"logps/chosen": -1.404799222946167,
"logps/rejected": -102.4892349243164,
"loss": 0.1313902586698532,
"memory(GiB)": 41.24,
"nll_loss": 0.09521690011024475,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.12229674309492111,
"rewards/margins": 8.041703224182129,
"rewards/rejected": -7.919405937194824,
"step": 45,
"train_speed(iter/s)": 0.010754
},
{
"epoch": 0.26522522522522524,
"grad_norm": 5.14201545715332,
"learning_rate": 0.00019918894936323195,
"logits/chosen": -0.3798273205757141,
"logits/rejected": -0.5865642428398132,
"logps/chosen": -6.911247730255127,
"logps/rejected": -72.06941223144531,
"loss": 0.49299517273902893,
"memory(GiB)": 41.24,
"nll_loss": 0.27924880385398865,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1307646483182907,
"rewards/margins": 5.647462368011475,
"rewards/rejected": -5.516696929931641,
"step": 46,
"train_speed(iter/s)": 0.010753
},
{
"epoch": 0.270990990990991,
"grad_norm": 1.6439752578735352,
"learning_rate": 0.00019910594076061853,
"logits/chosen": -0.4431299567222595,
"logits/rejected": -0.7268660664558411,
"logps/chosen": -2.0275888442993164,
"logps/rejected": -81.84529876708984,
"loss": 0.23740296065807343,
"memory(GiB)": 41.24,
"nll_loss": 0.14832313358783722,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.06923090666532516,
"rewards/margins": 6.1783928871154785,
"rewards/rejected": -6.109161376953125,
"step": 47,
"train_speed(iter/s)": 0.010753
},
{
"epoch": 0.27675675675675676,
"grad_norm": 6.499570846557617,
"learning_rate": 0.0001990189077303418,
"logits/chosen": -0.45142635703086853,
"logits/rejected": -0.7249264121055603,
"logps/chosen": -5.794652938842773,
"logps/rejected": -78.53363800048828,
"loss": 0.46158841252326965,
"memory(GiB)": 41.24,
"nll_loss": 0.3398270010948181,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24555836617946625,
"rewards/margins": 6.308343887329102,
"rewards/rejected": -6.062786102294922,
"step": 48,
"train_speed(iter/s)": 0.010753
},
{
"epoch": 0.2825225225225225,
"grad_norm": 5.58511209487915,
"learning_rate": 0.00019892785380658078,
"logits/chosen": -0.4099079370498657,
"logits/rejected": -0.6898340582847595,
"logps/chosen": -7.449429035186768,
"logps/rejected": -92.18098449707031,
"loss": 0.5815075039863586,
"memory(GiB)": 41.24,
"nll_loss": 0.41358357667922974,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.053265977650880814,
"rewards/margins": 7.150655269622803,
"rewards/rejected": -7.203920841217041,
"step": 49,
"train_speed(iter/s)": 0.010752
},
{
"epoch": 0.2882882882882883,
"grad_norm": 1.5411535501480103,
"learning_rate": 0.00019883278268679216,
"logits/chosen": -0.4670988917350769,
"logits/rejected": -0.6586328148841858,
"logps/chosen": -6.984646320343018,
"logps/rejected": -89.9208755493164,
"loss": 0.45735102891921997,
"memory(GiB)": 41.24,
"nll_loss": 0.28862154483795166,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1682412177324295,
"rewards/margins": 7.457679748535156,
"rewards/rejected": -7.289438247680664,
"step": 50,
"train_speed(iter/s)": 0.01075
}
],
"logging_steps": 1,
"max_steps": 519,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.7372458004709376e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}