File size: 25,941 Bytes
9567d83
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.7248506220001959,
  "eval_steps": 200,
  "global_step": 1850,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.019590557351356647,
      "grad_norm": 152.70944213867188,
      "learning_rate": 3.2666666666666663e-07,
      "logits/chosen": -2.876490592956543,
      "logits/rejected": -2.730497121810913,
      "logps/chosen": -467.5262756347656,
      "logps/rejected": -378.40655517578125,
      "loss": 0.64,
      "rewards/accuracies": 0.6175000071525574,
      "rewards/chosen": 0.30685558915138245,
      "rewards/margins": 0.14467713236808777,
      "rewards/rejected": 0.16217847168445587,
      "step": 50
    },
    {
      "epoch": 0.03918111470271329,
      "grad_norm": 169.46041870117188,
      "learning_rate": 6.6e-07,
      "logits/chosen": -2.9327621459960938,
      "logits/rejected": -2.691812038421631,
      "logps/chosen": -459.0450439453125,
      "logps/rejected": -358.7035217285156,
      "loss": 0.5732,
      "rewards/accuracies": 0.7200000286102295,
      "rewards/chosen": 0.8860471844673157,
      "rewards/margins": 0.42572346329689026,
      "rewards/rejected": 0.4603237509727478,
      "step": 100
    },
    {
      "epoch": 0.05877167205406994,
      "grad_norm": 163.8626708984375,
      "learning_rate": 9.933333333333333e-07,
      "logits/chosen": -2.9648749828338623,
      "logits/rejected": -2.746995449066162,
      "logps/chosen": -450.51348876953125,
      "logps/rejected": -383.9017333984375,
      "loss": 0.5708,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 1.1387741565704346,
      "rewards/margins": 0.5126526355743408,
      "rewards/rejected": 0.626121461391449,
      "step": 150
    },
    {
      "epoch": 0.07836222940542659,
      "grad_norm": 101.9367446899414,
      "learning_rate": 9.99894936347371e-07,
      "logits/chosen": -3.0323171615600586,
      "logits/rejected": -2.8769636154174805,
      "logps/chosen": -467.7211608886719,
      "logps/rejected": -375.92816162109375,
      "loss": 0.5266,
      "rewards/accuracies": 0.7174999713897705,
      "rewards/chosen": 1.2015265226364136,
      "rewards/margins": 0.7129627466201782,
      "rewards/rejected": 0.48856377601623535,
      "step": 200
    },
    {
      "epoch": 0.07836222940542659,
      "eval_logits/chosen": -2.2541391849517822,
      "eval_logits/rejected": -2.285670042037964,
      "eval_logps/chosen": -172.0572509765625,
      "eval_logps/rejected": -200.56900024414062,
      "eval_loss": 0.6408354640007019,
      "eval_rewards/accuracies": 0.7420290112495422,
      "eval_rewards/chosen": 0.0233369879424572,
      "eval_rewards/margins": 0.1684449017047882,
      "eval_rewards/rejected": -0.1451079100370407,
      "eval_runtime": 45.4466,
      "eval_samples_per_second": 15.183,
      "eval_steps_per_second": 7.591,
      "step": 200
    },
    {
      "epoch": 0.09795278675678323,
      "grad_norm": 106.43968200683594,
      "learning_rate": 9.995711712979657e-07,
      "logits/chosen": -2.953029155731201,
      "logits/rejected": -2.7987329959869385,
      "logps/chosen": -462.841796875,
      "logps/rejected": -378.1797790527344,
      "loss": 0.4989,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 1.3110496997833252,
      "rewards/margins": 0.854219377040863,
      "rewards/rejected": 0.4568302035331726,
      "step": 250
    },
    {
      "epoch": 0.11754334410813988,
      "grad_norm": 105.10195922851562,
      "learning_rate": 9.990288027658056e-07,
      "logits/chosen": -2.9163262844085693,
      "logits/rejected": -2.7455270290374756,
      "logps/chosen": -438.2953186035156,
      "logps/rejected": -367.7381591796875,
      "loss": 0.5314,
      "rewards/accuracies": 0.7400000095367432,
      "rewards/chosen": 1.436720848083496,
      "rewards/margins": 0.8745988607406616,
      "rewards/rejected": 0.5621219277381897,
      "step": 300
    },
    {
      "epoch": 0.13713390145949653,
      "grad_norm": 73.22066497802734,
      "learning_rate": 9.982680680817391e-07,
      "logits/chosen": -2.966728448867798,
      "logits/rejected": -2.765995740890503,
      "logps/chosen": -447.7353210449219,
      "logps/rejected": -349.2236633300781,
      "loss": 0.4596,
      "rewards/accuracies": 0.7900000214576721,
      "rewards/chosen": 1.517472267150879,
      "rewards/margins": 1.1284364461898804,
      "rewards/rejected": 0.3890356719493866,
      "step": 350
    },
    {
      "epoch": 0.15672445881085317,
      "grad_norm": 193.4586181640625,
      "learning_rate": 9.972893001297698e-07,
      "logits/chosen": -2.92069935798645,
      "logits/rejected": -2.7497365474700928,
      "logps/chosen": -460.17755126953125,
      "logps/rejected": -371.06011962890625,
      "loss": 0.51,
      "rewards/accuracies": 0.7350000143051147,
      "rewards/chosen": 1.5156035423278809,
      "rewards/margins": 1.070378065109253,
      "rewards/rejected": 0.44522520899772644,
      "step": 400
    },
    {
      "epoch": 0.15672445881085317,
      "eval_logits/chosen": -2.2648189067840576,
      "eval_logits/rejected": -2.2913312911987305,
      "eval_logps/chosen": -172.1621856689453,
      "eval_logps/rejected": -201.6964874267578,
      "eval_loss": 0.6150330305099487,
      "eval_rewards/accuracies": 0.7710145115852356,
      "eval_rewards/chosen": 0.012844223529100418,
      "eval_rewards/margins": 0.2707003951072693,
      "eval_rewards/rejected": -0.25785619020462036,
      "eval_runtime": 45.871,
      "eval_samples_per_second": 15.042,
      "eval_steps_per_second": 7.521,
      "step": 400
    },
    {
      "epoch": 0.17631501616220982,
      "grad_norm": 142.24362182617188,
      "learning_rate": 9.96092927201391e-07,
      "logits/chosen": -2.922132968902588,
      "logits/rejected": -2.754628896713257,
      "logps/chosen": -446.7215270996094,
      "logps/rejected": -385.2563171386719,
      "loss": 0.4712,
      "rewards/accuracies": 0.7574999928474426,
      "rewards/chosen": 1.4054139852523804,
      "rewards/margins": 1.1510262489318848,
      "rewards/rejected": 0.25438761711120605,
      "step": 450
    },
    {
      "epoch": 0.19590557351356647,
      "grad_norm": 99.2269515991211,
      "learning_rate": 9.946794728081737e-07,
      "logits/chosen": -3.007890224456787,
      "logits/rejected": -2.8413093090057373,
      "logps/chosen": -465.13348388671875,
      "logps/rejected": -390.49591064453125,
      "loss": 0.4768,
      "rewards/accuracies": 0.7799999713897705,
      "rewards/chosen": 1.604026198387146,
      "rewards/margins": 1.1249028444290161,
      "rewards/rejected": 0.47912338376045227,
      "step": 500
    },
    {
      "epoch": 0.2154961308649231,
      "grad_norm": 169.93678283691406,
      "learning_rate": 9.930495554526878e-07,
      "logits/chosen": -2.952453851699829,
      "logits/rejected": -2.812680959701538,
      "logps/chosen": -449.0242919921875,
      "logps/rejected": -357.1375732421875,
      "loss": 0.4962,
      "rewards/accuracies": 0.7724999785423279,
      "rewards/chosen": 1.6039185523986816,
      "rewards/margins": 1.0116550922393799,
      "rewards/rejected": 0.5922635793685913,
      "step": 550
    },
    {
      "epoch": 0.23508668821627976,
      "grad_norm": 272.4690856933594,
      "learning_rate": 9.912038883578552e-07,
      "logits/chosen": -2.9756484031677246,
      "logits/rejected": -2.760322332382202,
      "logps/chosen": -460.68865966796875,
      "logps/rejected": -377.5042724609375,
      "loss": 0.5151,
      "rewards/accuracies": 0.7799999713897705,
      "rewards/chosen": 1.6494457721710205,
      "rewards/margins": 1.0801762342453003,
      "rewards/rejected": 0.5692696571350098,
      "step": 600
    },
    {
      "epoch": 0.23508668821627976,
      "eval_logits/chosen": -2.328936815261841,
      "eval_logits/rejected": -2.3488407135009766,
      "eval_logps/chosen": -173.3373565673828,
      "eval_logps/rejected": -202.97079467773438,
      "eval_loss": 0.6263740062713623,
      "eval_rewards/accuracies": 0.7507246136665344,
      "eval_rewards/chosen": -0.10467354953289032,
      "eval_rewards/margins": 0.2806117534637451,
      "eval_rewards/rejected": -0.38528531789779663,
      "eval_runtime": 45.7131,
      "eval_samples_per_second": 15.094,
      "eval_steps_per_second": 7.547,
      "step": 600
    },
    {
      "epoch": 0.2546772455676364,
      "grad_norm": 72.5123291015625,
      "learning_rate": 9.891432791548562e-07,
      "logits/chosen": -2.9478814601898193,
      "logits/rejected": -2.767559766769409,
      "logps/chosen": -429.18499755859375,
      "logps/rejected": -369.6413269042969,
      "loss": 0.4703,
      "rewards/accuracies": 0.7649999856948853,
      "rewards/chosen": 1.570642113685608,
      "rewards/margins": 1.231786847114563,
      "rewards/rejected": 0.3388552963733673,
      "step": 650
    },
    {
      "epoch": 0.27426780291899305,
      "grad_norm": 146.4647979736328,
      "learning_rate": 9.868686295297258e-07,
      "logits/chosen": -2.9772324562072754,
      "logits/rejected": -2.7840633392333984,
      "logps/chosen": -452.4783630371094,
      "logps/rejected": -379.3604736328125,
      "loss": 0.4646,
      "rewards/accuracies": 0.7674999833106995,
      "rewards/chosen": 1.685501217842102,
      "rewards/margins": 1.2647416591644287,
      "rewards/rejected": 0.4207596480846405,
      "step": 700
    },
    {
      "epoch": 0.29385836027034967,
      "grad_norm": 115.44526672363281,
      "learning_rate": 9.8438093482879e-07,
      "logits/chosen": -3.0253145694732666,
      "logits/rejected": -2.8723714351654053,
      "logps/chosen": -461.543212890625,
      "logps/rejected": -378.514892578125,
      "loss": 0.5084,
      "rewards/accuracies": 0.7549999952316284,
      "rewards/chosen": 1.5600999593734741,
      "rewards/margins": 1.2082923650741577,
      "rewards/rejected": 0.3518076241016388,
      "step": 750
    },
    {
      "epoch": 0.31344891762170635,
      "grad_norm": 49.29530334472656,
      "learning_rate": 9.81681283623121e-07,
      "logits/chosen": -3.0215282440185547,
      "logits/rejected": -2.831230401992798,
      "logps/chosen": -469.9809875488281,
      "logps/rejected": -369.4506530761719,
      "loss": 0.4662,
      "rewards/accuracies": 0.800000011920929,
      "rewards/chosen": 1.9505739212036133,
      "rewards/margins": 1.3873133659362793,
      "rewards/rejected": 0.5632606744766235,
      "step": 800
    },
    {
      "epoch": 0.31344891762170635,
      "eval_logits/chosen": -2.373304843902588,
      "eval_logits/rejected": -2.391378402709961,
      "eval_logps/chosen": -174.7285614013672,
      "eval_logps/rejected": -204.59425354003906,
      "eval_loss": 0.6305972933769226,
      "eval_rewards/accuracies": 0.7681159377098083,
      "eval_rewards/chosen": -0.2437940239906311,
      "eval_rewards/margins": 0.30383673310279846,
      "eval_rewards/rejected": -0.547630786895752,
      "eval_runtime": 45.7764,
      "eval_samples_per_second": 15.073,
      "eval_steps_per_second": 7.537,
      "step": 800
    },
    {
      "epoch": 0.33303947497306297,
      "grad_norm": 144.90708923339844,
      "learning_rate": 9.787708572321983e-07,
      "logits/chosen": -2.910259485244751,
      "logits/rejected": -2.762113332748413,
      "logps/chosen": -452.485107421875,
      "logps/rejected": -337.2020568847656,
      "loss": 0.5209,
      "rewards/accuracies": 0.7400000095367432,
      "rewards/chosen": 2.068610906600952,
      "rewards/margins": 1.3179844617843628,
      "rewards/rejected": 0.7506266236305237,
      "step": 850
    },
    {
      "epoch": 0.35263003232441964,
      "grad_norm": 130.08224487304688,
      "learning_rate": 9.756509292069825e-07,
      "logits/chosen": -2.9319863319396973,
      "logits/rejected": -2.783926010131836,
      "logps/chosen": -419.07110595703125,
      "logps/rejected": -382.4843444824219,
      "loss": 0.5003,
      "rewards/accuracies": 0.762499988079071,
      "rewards/chosen": 1.7963037490844727,
      "rewards/margins": 1.2497668266296387,
      "rewards/rejected": 0.5465368032455444,
      "step": 900
    },
    {
      "epoch": 0.37222058967577626,
      "grad_norm": 151.3379669189453,
      "learning_rate": 9.72322864772634e-07,
      "logits/chosen": -3.0067360401153564,
      "logits/rejected": -2.8380017280578613,
      "logps/chosen": -463.267822265625,
      "logps/rejected": -379.6971130371094,
      "loss": 0.4351,
      "rewards/accuracies": 0.8050000071525574,
      "rewards/chosen": 1.8822674751281738,
      "rewards/margins": 1.517218828201294,
      "rewards/rejected": 0.36504870653152466,
      "step": 950
    },
    {
      "epoch": 0.39181114702713293,
      "grad_norm": 127.39634704589844,
      "learning_rate": 9.687881202311132e-07,
      "logits/chosen": -2.975214958190918,
      "logits/rejected": -2.7904016971588135,
      "logps/chosen": -459.6684875488281,
      "logps/rejected": -384.0487060546875,
      "loss": 0.5026,
      "rewards/accuracies": 0.7574999928474426,
      "rewards/chosen": 2.054124355316162,
      "rewards/margins": 1.4798840284347534,
      "rewards/rejected": 0.5742404460906982,
      "step": 1000
    },
    {
      "epoch": 0.39181114702713293,
      "eval_logits/chosen": -2.285802125930786,
      "eval_logits/rejected": -2.3008267879486084,
      "eval_logps/chosen": -173.751953125,
      "eval_logps/rejected": -203.65634155273438,
      "eval_loss": 0.6286672353744507,
      "eval_rewards/accuracies": 0.7579709887504578,
      "eval_rewards/chosen": -0.14613337814807892,
      "eval_rewards/margins": 0.3077085614204407,
      "eval_rewards/rejected": -0.453841894865036,
      "eval_runtime": 45.6208,
      "eval_samples_per_second": 15.125,
      "eval_steps_per_second": 7.562,
      "step": 1000
    },
    {
      "epoch": 0.41140170437848955,
      "grad_norm": 113.51675415039062,
      "learning_rate": 9.65048242323929e-07,
      "logits/chosen": -2.9107511043548584,
      "logits/rejected": -2.766993522644043,
      "logps/chosen": -419.68035888671875,
      "logps/rejected": -354.5930480957031,
      "loss": 0.4776,
      "rewards/accuracies": 0.7825000286102295,
      "rewards/chosen": 1.6637612581253052,
      "rewards/margins": 1.2595511674880981,
      "rewards/rejected": 0.40421026945114136,
      "step": 1050
    },
    {
      "epoch": 0.4309922617298462,
      "grad_norm": 142.44851684570312,
      "learning_rate": 9.611048675553127e-07,
      "logits/chosen": -2.945481061935425,
      "logits/rejected": -2.7998950481414795,
      "logps/chosen": -473.3480529785156,
      "logps/rejected": -378.8951416015625,
      "loss": 0.4899,
      "rewards/accuracies": 0.7799999713897705,
      "rewards/chosen": 1.8652592897415161,
      "rewards/margins": 1.3835867643356323,
      "rewards/rejected": 0.48167240619659424,
      "step": 1100
    },
    {
      "epoch": 0.45058281908120285,
      "grad_norm": 110.11934661865234,
      "learning_rate": 9.569597214761124e-07,
      "logits/chosen": -2.9105591773986816,
      "logits/rejected": -2.7662746906280518,
      "logps/chosen": -445.8592834472656,
      "logps/rejected": -364.0835266113281,
      "loss": 0.4642,
      "rewards/accuracies": 0.800000011920929,
      "rewards/chosen": 1.9219467639923096,
      "rewards/margins": 1.473950982093811,
      "rewards/rejected": 0.4479956328868866,
      "step": 1150
    },
    {
      "epoch": 0.4701733764325595,
      "grad_norm": 180.00526428222656,
      "learning_rate": 9.526146179287222e-07,
      "logits/chosen": -2.8630211353302,
      "logits/rejected": -2.6804027557373047,
      "logps/chosen": -449.76812744140625,
      "logps/rejected": -364.3941650390625,
      "loss": 0.5097,
      "rewards/accuracies": 0.7325000166893005,
      "rewards/chosen": 1.7920465469360352,
      "rewards/margins": 1.2713873386383057,
      "rewards/rejected": 0.5206592082977295,
      "step": 1200
    },
    {
      "epoch": 0.4701733764325595,
      "eval_logits/chosen": -2.2779555320739746,
      "eval_logits/rejected": -2.2900030612945557,
      "eval_logps/chosen": -173.5331573486328,
      "eval_logps/rejected": -203.9847869873047,
      "eval_loss": 0.6131945848464966,
      "eval_rewards/accuracies": 0.7449275255203247,
      "eval_rewards/chosen": -0.12425270676612854,
      "eval_rewards/margins": 0.36243319511413574,
      "eval_rewards/rejected": -0.4866859018802643,
      "eval_runtime": 45.8929,
      "eval_samples_per_second": 15.035,
      "eval_steps_per_second": 7.517,
      "step": 1200
    },
    {
      "epoch": 0.48976393378391614,
      "grad_norm": 160.4936065673828,
      "learning_rate": 9.480714582533773e-07,
      "logits/chosen": -2.8644652366638184,
      "logits/rejected": -2.7200751304626465,
      "logps/chosen": -454.3363952636719,
      "logps/rejected": -376.8122253417969,
      "loss": 0.4958,
      "rewards/accuracies": 0.7524999976158142,
      "rewards/chosen": 2.13558292388916,
      "rewards/margins": 1.546592354774475,
      "rewards/rejected": 0.5889905691146851,
      "step": 1250
    },
    {
      "epoch": 0.5093544911352728,
      "grad_norm": 108.44024658203125,
      "learning_rate": 9.433322304561614e-07,
      "logits/chosen": -2.942742347717285,
      "logits/rejected": -2.7668235301971436,
      "logps/chosen": -450.0126647949219,
      "logps/rejected": -390.0963134765625,
      "loss": 0.4247,
      "rewards/accuracies": 0.762499988079071,
      "rewards/chosen": 1.9560456275939941,
      "rewards/margins": 1.6855427026748657,
      "rewards/rejected": 0.27050289511680603,
      "step": 1300
    },
    {
      "epoch": 0.5289450484866295,
      "grad_norm": 280.08380126953125,
      "learning_rate": 9.383990083390903e-07,
      "logits/chosen": -2.957747220993042,
      "logits/rejected": -2.795564889907837,
      "logps/chosen": -453.2030334472656,
      "logps/rejected": -413.6679992675781,
      "loss": 0.4633,
      "rewards/accuracies": 0.7674999833106995,
      "rewards/chosen": 1.6891446113586426,
      "rewards/margins": 1.4608780145645142,
      "rewards/rejected": 0.22826646268367767,
      "step": 1350
    },
    {
      "epoch": 0.5485356058379861,
      "grad_norm": 214.8365478515625,
      "learning_rate": 9.332739505926528e-07,
      "logits/chosen": -2.917468309402466,
      "logits/rejected": -2.753814697265625,
      "logps/chosen": -471.89483642578125,
      "logps/rejected": -402.4897155761719,
      "loss": 0.4122,
      "rewards/accuracies": 0.8025000095367432,
      "rewards/chosen": 1.7866332530975342,
      "rewards/margins": 1.777306318283081,
      "rewards/rejected": 0.009327063336968422,
      "step": 1400
    },
    {
      "epoch": 0.5485356058379861,
      "eval_logits/chosen": -2.384613275527954,
      "eval_logits/rejected": -2.4019815921783447,
      "eval_logps/chosen": -176.3463592529297,
      "eval_logps/rejected": -207.75599670410156,
      "eval_loss": 0.5938982367515564,
      "eval_rewards/accuracies": 0.7782608866691589,
      "eval_rewards/chosen": -0.40557393431663513,
      "eval_rewards/margins": 0.4582330286502838,
      "eval_rewards/rejected": -0.863806962966919,
      "eval_runtime": 45.9899,
      "eval_samples_per_second": 15.003,
      "eval_steps_per_second": 7.502,
      "step": 1400
    },
    {
      "epoch": 0.5681261631893427,
      "grad_norm": 143.27638244628906,
      "learning_rate": 9.279592998512064e-07,
      "logits/chosen": -2.954049587249756,
      "logits/rejected": -2.828245162963867,
      "logps/chosen": -467.3232116699219,
      "logps/rejected": -384.35601806640625,
      "loss": 0.4616,
      "rewards/accuracies": 0.7900000214576721,
      "rewards/chosen": 1.6394932270050049,
      "rewards/margins": 1.5439642667770386,
      "rewards/rejected": 0.09552911669015884,
      "step": 1450
    },
    {
      "epoch": 0.5877167205406993,
      "grad_norm": 70.37281799316406,
      "learning_rate": 9.224573817116396e-07,
      "logits/chosen": -2.9961767196655273,
      "logits/rejected": -2.8868143558502197,
      "logps/chosen": -478.9124755859375,
      "logps/rejected": -402.163330078125,
      "loss": 0.3946,
      "rewards/accuracies": 0.8174999952316284,
      "rewards/chosen": 2.2281653881073,
      "rewards/margins": 2.0543277263641357,
      "rewards/rejected": 0.17383766174316406,
      "step": 1500
    },
    {
      "epoch": 0.6073072778920561,
      "grad_norm": 116.5025863647461,
      "learning_rate": 9.16770603715733e-07,
      "logits/chosen": -2.935271978378296,
      "logits/rejected": -2.8107409477233887,
      "logps/chosen": -448.86444091796875,
      "logps/rejected": -377.48944091796875,
      "loss": 0.5143,
      "rewards/accuracies": 0.7599999904632568,
      "rewards/chosen": 1.8645941019058228,
      "rewards/margins": 1.5373382568359375,
      "rewards/rejected": 0.3272559642791748,
      "step": 1550
    },
    {
      "epoch": 0.6268978352434127,
      "grad_norm": 115.91889190673828,
      "learning_rate": 9.109014542966609e-07,
      "logits/chosen": -3.030916452407837,
      "logits/rejected": -2.8699285984039307,
      "logps/chosen": -430.56219482421875,
      "logps/rejected": -374.2171936035156,
      "loss": 0.5026,
      "rewards/accuracies": 0.762499988079071,
      "rewards/chosen": 1.8679478168487549,
      "rewards/margins": 1.4932770729064941,
      "rewards/rejected": 0.3746708631515503,
      "step": 1600
    },
    {
      "epoch": 0.6268978352434127,
      "eval_logits/chosen": -2.468580484390259,
      "eval_logits/rejected": -2.4822895526885986,
      "eval_logps/chosen": -177.13941955566406,
      "eval_logps/rejected": -209.1125030517578,
      "eval_loss": 0.590223491191864,
      "eval_rewards/accuracies": 0.7927536368370056,
      "eval_rewards/chosen": -0.484881192445755,
      "eval_rewards/margins": 0.514574408531189,
      "eval_rewards/rejected": -0.9994555711746216,
      "eval_runtime": 45.9912,
      "eval_samples_per_second": 15.003,
      "eval_steps_per_second": 7.501,
      "step": 1600
    },
    {
      "epoch": 0.6464883925947693,
      "grad_norm": 144.60536193847656,
      "learning_rate": 9.04852501690097e-07,
      "logits/chosen": -3.0554418563842773,
      "logits/rejected": -2.916806221008301,
      "logps/chosen": -448.33453369140625,
      "logps/rejected": -382.4766540527344,
      "loss": 0.4249,
      "rewards/accuracies": 0.7950000166893005,
      "rewards/chosen": 1.6690967082977295,
      "rewards/margins": 1.7366982698440552,
      "rewards/rejected": -0.06760149449110031,
      "step": 1650
    },
    {
      "epoch": 0.6660789499461259,
      "grad_norm": 204.64212036132812,
      "learning_rate": 8.986263928104007e-07,
      "logits/chosen": -2.9387013912200928,
      "logits/rejected": -2.8714663982391357,
      "logps/chosen": -462.238525390625,
      "logps/rejected": -362.3359069824219,
      "loss": 0.4699,
      "rewards/accuracies": 0.7724999785423279,
      "rewards/chosen": 2.0341713428497314,
      "rewards/margins": 1.6428416967391968,
      "rewards/rejected": 0.39132973551750183,
      "step": 1700
    },
    {
      "epoch": 0.6856695072974827,
      "grad_norm": 158.81417846679688,
      "learning_rate": 8.922258520923739e-07,
      "logits/chosen": -2.928734064102173,
      "logits/rejected": -2.7294297218322754,
      "logps/chosen": -432.1619873046875,
      "logps/rejected": -378.280517578125,
      "loss": 0.5039,
      "rewards/accuracies": 0.7699999809265137,
      "rewards/chosen": 1.977944016456604,
      "rewards/margins": 1.4837253093719482,
      "rewards/rejected": 0.4942188262939453,
      "step": 1750
    },
    {
      "epoch": 0.7052600646488393,
      "grad_norm": 128.84994506835938,
      "learning_rate": 8.856536802990969e-07,
      "logits/chosen": -2.9586968421936035,
      "logits/rejected": -2.868234634399414,
      "logps/chosen": -432.3280334472656,
      "logps/rejected": -376.2671203613281,
      "loss": 0.461,
      "rewards/accuracies": 0.7799999713897705,
      "rewards/chosen": 1.9399315118789673,
      "rewards/margins": 1.5768976211547852,
      "rewards/rejected": 0.36303389072418213,
      "step": 1800
    },
    {
      "epoch": 0.7052600646488393,
      "eval_logits/chosen": -2.4123268127441406,
      "eval_logits/rejected": -2.4266409873962402,
      "eval_logps/chosen": -174.25506591796875,
      "eval_logps/rejected": -205.96014404296875,
      "eval_loss": 0.5846713185310364,
      "eval_rewards/accuracies": 0.8202898502349854,
      "eval_rewards/chosen": -0.19644570350646973,
      "eval_rewards/margins": 0.4877746105194092,
      "eval_rewards/rejected": -0.6842203140258789,
      "eval_runtime": 45.7164,
      "eval_samples_per_second": 15.093,
      "eval_steps_per_second": 7.547,
      "step": 1800
    },
    {
      "epoch": 0.7248506220001959,
      "grad_norm": 227.02520751953125,
      "learning_rate": 8.789127532963639e-07,
      "logits/chosen": -2.9502925872802734,
      "logits/rejected": -2.8222861289978027,
      "logps/chosen": -459.9781188964844,
      "logps/rejected": -375.967041015625,
      "loss": 0.3961,
      "rewards/accuracies": 0.800000011920929,
      "rewards/chosen": 2.2383108139038086,
      "rewards/margins": 1.8207529783248901,
      "rewards/rejected": 0.4175575375556946,
      "step": 1850
    }
  ],
  "logging_steps": 50,
  "max_steps": 7659,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 3,
  "save_steps": 370,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 0.0,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}