File size: 31,285 Bytes
6154784
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.2544529262086514,
  "eval_steps": 500,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "entropy": 0.167724609375,
      "epoch": 0.005089058524173028,
      "grad_norm": 63.83088684082031,
      "learning_rate": 5e-06,
      "logits/chosen": -1.1478307765991018,
      "logits/rejected": -1.1531979437304007,
      "logps/chosen": -230.5,
      "logps/rejected": -250.5,
      "loss": 0.726806640625,
      "mean_token_accuracy": 0.9508575797080994,
      "num_tokens": 387774.0,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -0.0360107421875,
      "rewards/margins": 0.007598876953125,
      "rewards/rejected": -0.04305267333984375,
      "step": 1
    },
    {
      "entropy": 0.1708984375,
      "epoch": 0.010178117048346057,
      "grad_norm": 58.35269546508789,
      "learning_rate": 4.974619289340102e-06,
      "logits/chosen": -1.1465309061137527,
      "logits/rejected": -1.1435811743754352,
      "logps/chosen": -202.75,
      "logps/rejected": -220.75,
      "loss": 0.73284912109375,
      "mean_token_accuracy": 0.9518170654773712,
      "num_tokens": 796045.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.01251220703125,
      "rewards/margins": -0.01416015625,
      "rewards/rejected": 0.00146484375,
      "step": 2
    },
    {
      "entropy": 0.1708984375,
      "epoch": 0.015267175572519083,
      "grad_norm": 52.742557525634766,
      "learning_rate": 4.949238578680203e-06,
      "logits/chosen": -1.22388826039798,
      "logits/rejected": -1.2534275052969308,
      "logps/chosen": -217.0,
      "logps/rejected": -210.75,
      "loss": 0.695587158203125,
      "mean_token_accuracy": 0.9499112516641617,
      "num_tokens": 1158499.0,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": -0.03204345703125,
      "rewards/margins": 0.07501220703125,
      "rewards/rejected": -0.1068115234375,
      "step": 3
    },
    {
      "entropy": 0.175537109375,
      "epoch": 0.020356234096692113,
      "grad_norm": 58.555728912353516,
      "learning_rate": 4.923857868020305e-06,
      "logits/chosen": -1.0887703188820197,
      "logits/rejected": -1.110711324029513,
      "logps/chosen": -247.5,
      "logps/rejected": -225.25,
      "loss": 0.7191162109375,
      "mean_token_accuracy": 0.9449715912342072,
      "num_tokens": 1526178.0,
      "rewards/accuracies": 0.4375,
      "rewards/chosen": -0.0124664306640625,
      "rewards/margins": 0.05133056640625,
      "rewards/rejected": -0.0640869140625,
      "step": 4
    },
    {
      "entropy": 0.181884765625,
      "epoch": 0.02544529262086514,
      "grad_norm": 57.25611114501953,
      "learning_rate": 4.898477157360406e-06,
      "logits/chosen": -1.1241738300809683,
      "logits/rejected": -1.1185368980659924,
      "logps/chosen": -197.25,
      "logps/rejected": -204.5,
      "loss": 0.746917724609375,
      "mean_token_accuracy": 0.9447457045316696,
      "num_tokens": 1898739.0,
      "rewards/accuracies": 0.375,
      "rewards/chosen": -0.036865234375,
      "rewards/margins": 0.0240478515625,
      "rewards/rejected": -0.06103515625,
      "step": 5
    },
    {
      "entropy": 0.172119140625,
      "epoch": 0.030534351145038167,
      "grad_norm": 55.632781982421875,
      "learning_rate": 4.873096446700508e-06,
      "logits/chosen": -1.118042467736593,
      "logits/rejected": -1.1188858755620001,
      "logps/chosen": -195.5,
      "logps/rejected": -213.5,
      "loss": 0.706695556640625,
      "mean_token_accuracy": 0.9515382200479507,
      "num_tokens": 2280846.0,
      "rewards/accuracies": 0.375,
      "rewards/chosen": -0.0267333984375,
      "rewards/margins": 0.051971435546875,
      "rewards/rejected": -0.07904052734375,
      "step": 6
    },
    {
      "entropy": 0.165283203125,
      "epoch": 0.035623409669211195,
      "grad_norm": 58.1217155456543,
      "learning_rate": 4.84771573604061e-06,
      "logits/chosen": -1.2056221529623334,
      "logits/rejected": -1.1698524733043854,
      "logps/chosen": -203.75,
      "logps/rejected": -237.5,
      "loss": 0.778106689453125,
      "mean_token_accuracy": 0.9536973237991333,
      "num_tokens": 2661565.0,
      "rewards/accuracies": 0.34375,
      "rewards/chosen": -0.047119140625,
      "rewards/margins": -0.0155029296875,
      "rewards/rejected": -0.031982421875,
      "step": 7
    },
    {
      "entropy": 0.16015625,
      "epoch": 0.04071246819338423,
      "grad_norm": 57.468605041503906,
      "learning_rate": 4.822335025380711e-06,
      "logits/chosen": -1.285398958255684,
      "logits/rejected": -1.2651885553215019,
      "logps/chosen": -185.25,
      "logps/rejected": -195.0,
      "loss": 0.76959228515625,
      "mean_token_accuracy": 0.9562991708517075,
      "num_tokens": 3011121.0,
      "rewards/accuracies": 0.4375,
      "rewards/chosen": -0.07479095458984375,
      "rewards/margins": -0.06903076171875,
      "rewards/rejected": -0.0052642822265625,
      "step": 8
    },
    {
      "entropy": 0.177978515625,
      "epoch": 0.04580152671755725,
      "grad_norm": 61.59230041503906,
      "learning_rate": 4.796954314720812e-06,
      "logits/chosen": -1.1463901211868202,
      "logits/rejected": -1.151384163231262,
      "logps/chosen": -262.0,
      "logps/rejected": -263.0,
      "loss": 0.77764892578125,
      "mean_token_accuracy": 0.9490418434143066,
      "num_tokens": 3364659.0,
      "rewards/accuracies": 0.375,
      "rewards/chosen": -0.0624542236328125,
      "rewards/margins": -0.07977294921875,
      "rewards/rejected": 0.017181396484375,
      "step": 9
    },
    {
      "entropy": 0.17041015625,
      "epoch": 0.05089058524173028,
      "grad_norm": 66.9396743774414,
      "learning_rate": 4.771573604060914e-06,
      "logits/chosen": -1.1312320566718426,
      "logits/rejected": -1.114105189953177,
      "logps/chosen": -246.25,
      "logps/rejected": -253.5,
      "loss": 0.784912109375,
      "mean_token_accuracy": 0.9495462626218796,
      "num_tokens": 3756722.0,
      "rewards/accuracies": 0.4375,
      "rewards/chosen": -0.11962890625,
      "rewards/margins": -0.0777587890625,
      "rewards/rejected": -0.0416259765625,
      "step": 10
    },
    {
      "entropy": 0.17041015625,
      "epoch": 0.05597964376590331,
      "grad_norm": 60.69718933105469,
      "learning_rate": 4.746192893401016e-06,
      "logits/chosen": -1.2082123033021486,
      "logits/rejected": -1.240414757271401,
      "logps/chosen": -206.75,
      "logps/rejected": -253.0,
      "loss": 0.77130126953125,
      "mean_token_accuracy": 0.9514396339654922,
      "num_tokens": 4150502.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.122711181640625,
      "rewards/margins": -0.0660400390625,
      "rewards/rejected": -0.056396484375,
      "step": 11
    },
    {
      "entropy": 0.166015625,
      "epoch": 0.061068702290076333,
      "grad_norm": 68.75598907470703,
      "learning_rate": 4.7208121827411175e-06,
      "logits/chosen": -1.1497054731535286,
      "logits/rejected": -1.1323881415685357,
      "logps/chosen": -233.0,
      "logps/rejected": -214.0,
      "loss": 0.81524658203125,
      "mean_token_accuracy": 0.9499669224023819,
      "num_tokens": 4548017.0,
      "rewards/accuracies": 0.3125,
      "rewards/chosen": -0.14825439453125,
      "rewards/margins": -0.148681640625,
      "rewards/rejected": 0.0008544921875,
      "step": 12
    },
    {
      "entropy": 0.171142578125,
      "epoch": 0.06615776081424936,
      "grad_norm": 54.791534423828125,
      "learning_rate": 4.695431472081219e-06,
      "logits/chosen": -1.1963053139896285,
      "logits/rejected": -1.164336637055035,
      "logps/chosen": -204.0,
      "logps/rejected": -226.5,
      "loss": 0.71929931640625,
      "mean_token_accuracy": 0.952528104186058,
      "num_tokens": 4902525.0,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -0.0484619140625,
      "rewards/margins": 0.0706787109375,
      "rewards/rejected": -0.1187744140625,
      "step": 13
    },
    {
      "entropy": 0.165771484375,
      "epoch": 0.07124681933842239,
      "grad_norm": 55.923667907714844,
      "learning_rate": 4.67005076142132e-06,
      "logits/chosen": -1.227218462140038,
      "logits/rejected": -1.2252739974581663,
      "logps/chosen": -204.0,
      "logps/rejected": -245.75,
      "loss": 0.681884765625,
      "mean_token_accuracy": 0.9524703174829483,
      "num_tokens": 5247776.0,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": 0.017791748046875,
      "rewards/margins": 0.07401275634765625,
      "rewards/rejected": -0.056304931640625,
      "step": 14
    },
    {
      "entropy": 0.16796875,
      "epoch": 0.07633587786259542,
      "grad_norm": 54.7180290222168,
      "learning_rate": 4.644670050761422e-06,
      "logits/chosen": -1.1794452967378677,
      "logits/rejected": -1.213616516672937,
      "logps/chosen": -208.75,
      "logps/rejected": -199.5,
      "loss": 0.7034912109375,
      "mean_token_accuracy": 0.9460672587156296,
      "num_tokens": 5614879.0,
      "rewards/accuracies": 0.375,
      "rewards/chosen": -0.097320556640625,
      "rewards/margins": 0.0595703125,
      "rewards/rejected": -0.15673828125,
      "step": 15
    },
    {
      "entropy": 0.176513671875,
      "epoch": 0.08142493638676845,
      "grad_norm": 62.994319915771484,
      "learning_rate": 4.6192893401015235e-06,
      "logits/chosen": -1.2212638279189771,
      "logits/rejected": -1.2088961146919388,
      "logps/chosen": -227.25,
      "logps/rejected": -213.0,
      "loss": 0.83746337890625,
      "mean_token_accuracy": 0.9471840560436249,
      "num_tokens": 5971613.0,
      "rewards/accuracies": 0.28125,
      "rewards/chosen": -0.173828125,
      "rewards/margins": -0.18463134765625,
      "rewards/rejected": 0.01068115234375,
      "step": 16
    },
    {
      "entropy": 0.169677734375,
      "epoch": 0.08651399491094147,
      "grad_norm": 60.76310348510742,
      "learning_rate": 4.593908629441624e-06,
      "logits/chosen": -1.2065562340385436,
      "logits/rejected": -1.2022840016395056,
      "logps/chosen": -218.5,
      "logps/rejected": -190.0,
      "loss": 0.77734375,
      "mean_token_accuracy": 0.9474756270647049,
      "num_tokens": 6368369.0,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": -0.067138671875,
      "rewards/margins": -0.05255126953125,
      "rewards/rejected": -0.0137939453125,
      "step": 17
    },
    {
      "entropy": 0.1748046875,
      "epoch": 0.0916030534351145,
      "grad_norm": 61.58626174926758,
      "learning_rate": 4.568527918781726e-06,
      "logits/chosen": -1.1644959212587278,
      "logits/rejected": -1.1554610862237855,
      "logps/chosen": -213.5,
      "logps/rejected": -256.5,
      "loss": 0.744384765625,
      "mean_token_accuracy": 0.9518721997737885,
      "num_tokens": 6749942.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.1009521484375,
      "rewards/margins": 0.003753662109375,
      "rewards/rejected": -0.104736328125,
      "step": 18
    },
    {
      "entropy": 0.170654296875,
      "epoch": 0.09669211195928754,
      "grad_norm": 69.10458374023438,
      "learning_rate": 4.543147208121828e-06,
      "logits/chosen": -1.2018930915056671,
      "logits/rejected": -1.1882594101155102,
      "logps/chosen": -208.75,
      "logps/rejected": -223.0,
      "loss": 0.7578125,
      "mean_token_accuracy": 0.9503921419382095,
      "num_tokens": 7150669.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.16357421875,
      "rewards/margins": -0.0054931640625,
      "rewards/rejected": -0.157958984375,
      "step": 19
    },
    {
      "entropy": 0.1708984375,
      "epoch": 0.10178117048346055,
      "grad_norm": 59.20901870727539,
      "learning_rate": 4.5177664974619295e-06,
      "logits/chosen": -1.153684045887259,
      "logits/rejected": -1.1406723101806675,
      "logps/chosen": -214.25,
      "logps/rejected": -235.75,
      "loss": 0.742584228515625,
      "mean_token_accuracy": 0.9510545581579208,
      "num_tokens": 7577633.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.1868896484375,
      "rewards/margins": -0.008544921875,
      "rewards/rejected": -0.17822265625,
      "step": 20
    },
    {
      "entropy": 0.160888671875,
      "epoch": 0.10687022900763359,
      "grad_norm": 53.25274658203125,
      "learning_rate": 4.492385786802031e-06,
      "logits/chosen": -1.2115618534718147,
      "logits/rejected": -1.1697568144140837,
      "logps/chosen": -220.5,
      "logps/rejected": -224.5,
      "loss": 0.6365966796875,
      "mean_token_accuracy": 0.954043835401535,
      "num_tokens": 7935697.0,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": -0.0498046875,
      "rewards/margins": 0.22021484375,
      "rewards/rejected": -0.2708282470703125,
      "step": 21
    },
    {
      "entropy": 0.1708984375,
      "epoch": 0.11195928753180662,
      "grad_norm": 64.42499542236328,
      "learning_rate": 4.467005076142132e-06,
      "logits/chosen": -1.163452744541083,
      "logits/rejected": -1.1574276551228084,
      "logps/chosen": -206.75,
      "logps/rejected": -249.0,
      "loss": 0.7249755859375,
      "mean_token_accuracy": 0.9557177871465683,
      "num_tokens": 8344719.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.064208984375,
      "rewards/margins": 0.043914794921875,
      "rewards/rejected": -0.108154296875,
      "step": 22
    },
    {
      "entropy": 0.1650390625,
      "epoch": 0.11704834605597965,
      "grad_norm": 57.46247863769531,
      "learning_rate": 4.441624365482234e-06,
      "logits/chosen": -1.184751779280805,
      "logits/rejected": -1.1601956141572203,
      "logps/chosen": -221.5,
      "logps/rejected": -223.5,
      "loss": 0.725341796875,
      "mean_token_accuracy": 0.9495507925748825,
      "num_tokens": 8715576.0,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -0.12018585205078125,
      "rewards/margins": 0.1531982421875,
      "rewards/rejected": -0.27362060546875,
      "step": 23
    },
    {
      "entropy": 0.166259765625,
      "epoch": 0.12213740458015267,
      "grad_norm": 88.59230041503906,
      "learning_rate": 4.4162436548223355e-06,
      "logits/chosen": -1.2269864585121328,
      "logits/rejected": -1.2167687340565112,
      "logps/chosen": -190.5,
      "logps/rejected": -223.25,
      "loss": 0.616790771484375,
      "mean_token_accuracy": 0.9541012793779373,
      "num_tokens": 9131729.0,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -0.0047607421875,
      "rewards/margins": 0.2396240234375,
      "rewards/rejected": -0.244873046875,
      "step": 24
    },
    {
      "entropy": 0.174560546875,
      "epoch": 0.1272264631043257,
      "grad_norm": 59.16816711425781,
      "learning_rate": 4.390862944162436e-06,
      "logits/chosen": -1.2085149622005857,
      "logits/rejected": -1.1962000528044974,
      "logps/chosen": -209.5,
      "logps/rejected": -248.25,
      "loss": 0.68780517578125,
      "mean_token_accuracy": 0.9498510509729385,
      "num_tokens": 9510884.0,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": -0.14385986328125,
      "rewards/margins": 0.06866455078125,
      "rewards/rejected": -0.212890625,
      "step": 25
    },
    {
      "entropy": 0.166259765625,
      "epoch": 0.13231552162849872,
      "grad_norm": 58.58485412597656,
      "learning_rate": 4.365482233502538e-06,
      "logits/chosen": -1.2357831115334332,
      "logits/rejected": -1.2414339305565623,
      "logps/chosen": -205.25,
      "logps/rejected": -210.0,
      "loss": 0.735107421875,
      "mean_token_accuracy": 0.9495077282190323,
      "num_tokens": 9892399.0,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -0.144287109375,
      "rewards/margins": 0.02099609375,
      "rewards/rejected": -0.16522216796875,
      "step": 26
    },
    {
      "entropy": 0.17333984375,
      "epoch": 0.13740458015267176,
      "grad_norm": 51.31973648071289,
      "learning_rate": 4.34010152284264e-06,
      "logits/chosen": -1.1937940321742593,
      "logits/rejected": -1.20553321824887,
      "logps/chosen": -185.875,
      "logps/rejected": -204.75,
      "loss": 0.66217041015625,
      "mean_token_accuracy": 0.9475287944078445,
      "num_tokens": 10284784.0,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -0.072509765625,
      "rewards/margins": 0.17462158203125,
      "rewards/rejected": -0.247314453125,
      "step": 27
    },
    {
      "entropy": 0.16552734375,
      "epoch": 0.14249363867684478,
      "grad_norm": 61.93020248413086,
      "learning_rate": 4.3147208121827415e-06,
      "logits/chosen": -1.2497175985959397,
      "logits/rejected": -1.2349540219835924,
      "logps/chosen": -185.5,
      "logps/rejected": -200.5,
      "loss": 0.785888671875,
      "mean_token_accuracy": 0.9526190459728241,
      "num_tokens": 10640064.0,
      "rewards/accuracies": 0.375,
      "rewards/chosen": -0.24853515625,
      "rewards/margins": -0.0711669921875,
      "rewards/rejected": -0.1773681640625,
      "step": 28
    },
    {
      "entropy": 0.168701171875,
      "epoch": 0.1475826972010178,
      "grad_norm": 47.82231903076172,
      "learning_rate": 4.289340101522843e-06,
      "logits/chosen": -1.2240958044550552,
      "logits/rejected": -1.2331657411234425,
      "logps/chosen": -164.75,
      "logps/rejected": -183.5,
      "loss": 0.64813232421875,
      "mean_token_accuracy": 0.9512129127979279,
      "num_tokens": 11043531.0,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -0.0230712890625,
      "rewards/margins": 0.1962890625,
      "rewards/rejected": -0.21942138671875,
      "step": 29
    },
    {
      "entropy": 0.166015625,
      "epoch": 0.15267175572519084,
      "grad_norm": 64.59899139404297,
      "learning_rate": 4.263959390862945e-06,
      "logits/chosen": -1.1938851832774966,
      "logits/rejected": -1.2063193481273322,
      "logps/chosen": -203.375,
      "logps/rejected": -209.25,
      "loss": 0.75030517578125,
      "mean_token_accuracy": 0.9482824355363846,
      "num_tokens": 11433645.0,
      "rewards/accuracies": 0.375,
      "rewards/chosen": -0.160888671875,
      "rewards/margins": 0.0379638671875,
      "rewards/rejected": -0.1988525390625,
      "step": 30
    },
    {
      "entropy": 0.174560546875,
      "epoch": 0.15776081424936386,
      "grad_norm": 50.42904281616211,
      "learning_rate": 4.238578680203046e-06,
      "logits/chosen": -1.1847193683809207,
      "logits/rejected": -1.2039758508125116,
      "logps/chosen": -187.0,
      "logps/rejected": -196.0,
      "loss": 0.6805324554443359,
      "mean_token_accuracy": 0.9458457380533218,
      "num_tokens": 11802241.0,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -0.01849365234375,
      "rewards/margins": 0.2666015625,
      "rewards/rejected": -0.285400390625,
      "step": 31
    },
    {
      "entropy": 0.164794921875,
      "epoch": 0.1628498727735369,
      "grad_norm": 65.630126953125,
      "learning_rate": 4.2131979695431475e-06,
      "logits/chosen": -1.2242753640413924,
      "logits/rejected": -1.2582800165640973,
      "logps/chosen": -237.25,
      "logps/rejected": -239.75,
      "loss": 0.762481689453125,
      "mean_token_accuracy": 0.9494172036647797,
      "num_tokens": 12168742.0,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": -0.256591796875,
      "rewards/margins": 0.0673828125,
      "rewards/rejected": -0.323486328125,
      "step": 32
    },
    {
      "entropy": 0.1669921875,
      "epoch": 0.16793893129770993,
      "grad_norm": 64.15123748779297,
      "learning_rate": 4.187817258883249e-06,
      "logits/chosen": -1.2054564969855512,
      "logits/rejected": -1.2242075139011555,
      "logps/chosen": -225.75,
      "logps/rejected": -242.25,
      "loss": 0.776153564453125,
      "mean_token_accuracy": 0.9507817625999451,
      "num_tokens": 12544019.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.259033203125,
      "rewards/margins": -0.0609130859375,
      "rewards/rejected": -0.1982421875,
      "step": 33
    },
    {
      "entropy": 0.16162109375,
      "epoch": 0.17302798982188294,
      "grad_norm": 59.748802185058594,
      "learning_rate": 4.162436548223351e-06,
      "logits/chosen": -1.1906290703191211,
      "logits/rejected": -1.2255973378124254,
      "logps/chosen": -185.5,
      "logps/rejected": -189.5,
      "loss": 0.81256103515625,
      "mean_token_accuracy": 0.951210081577301,
      "num_tokens": 12934809.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.261016845703125,
      "rewards/margins": -0.1204071044921875,
      "rewards/rejected": -0.140380859375,
      "step": 34
    },
    {
      "entropy": 0.160400390625,
      "epoch": 0.178117048346056,
      "grad_norm": 62.484031677246094,
      "learning_rate": 4.137055837563453e-06,
      "logits/chosen": -1.1568720249350068,
      "logits/rejected": -1.1932806025584015,
      "logps/chosen": -214.75,
      "logps/rejected": -264.25,
      "loss": 0.743255615234375,
      "mean_token_accuracy": 0.952626571059227,
      "num_tokens": 13333240.0,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -0.19916534423828125,
      "rewards/margins": 0.0906982421875,
      "rewards/rejected": -0.2904052734375,
      "step": 35
    },
    {
      "entropy": 0.168701171875,
      "epoch": 0.183206106870229,
      "grad_norm": 57.09201431274414,
      "learning_rate": 4.1116751269035535e-06,
      "logits/chosen": -1.244021900396991,
      "logits/rejected": -1.2053838438463438,
      "logps/chosen": -227.75,
      "logps/rejected": -235.75,
      "loss": 0.598724365234375,
      "mean_token_accuracy": 0.9517507553100586,
      "num_tokens": 13672135.0,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.099365234375,
      "rewards/margins": 0.307861328125,
      "rewards/rejected": -0.4072265625,
      "step": 36
    },
    {
      "entropy": 0.168212890625,
      "epoch": 0.18829516539440203,
      "grad_norm": 70.22441101074219,
      "learning_rate": 4.086294416243655e-06,
      "logits/chosen": -1.2293163289174895,
      "logits/rejected": -1.2229109217299612,
      "logps/chosen": -224.25,
      "logps/rejected": -227.75,
      "loss": 0.82135009765625,
      "mean_token_accuracy": 0.9494140148162842,
      "num_tokens": 14069079.0,
      "rewards/accuracies": 0.34375,
      "rewards/chosen": -0.0679931640625,
      "rewards/margins": -0.12286376953125,
      "rewards/rejected": 0.0546875,
      "step": 37
    },
    {
      "entropy": 0.16357421875,
      "epoch": 0.19338422391857507,
      "grad_norm": 76.26187896728516,
      "learning_rate": 4.060913705583757e-06,
      "logits/chosen": -1.210362411249237,
      "logits/rejected": -1.2507633848434636,
      "logps/chosen": -263.5,
      "logps/rejected": -245.75,
      "loss": 0.789825439453125,
      "mean_token_accuracy": 0.9464226067066193,
      "num_tokens": 14439718.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.00927734375,
      "rewards/margins": -0.00775146484375,
      "rewards/rejected": -0.001953125,
      "step": 38
    },
    {
      "entropy": 0.1767578125,
      "epoch": 0.1984732824427481,
      "grad_norm": 60.25480270385742,
      "learning_rate": 4.035532994923858e-06,
      "logits/chosen": -1.2676762543068074,
      "logits/rejected": -1.2517246495133931,
      "logps/chosen": -240.25,
      "logps/rejected": -250.0,
      "loss": 0.706390380859375,
      "mean_token_accuracy": 0.9461905360221863,
      "num_tokens": 14842983.0,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -0.234130859375,
      "rewards/margins": 0.1005859375,
      "rewards/rejected": -0.334716796875,
      "step": 39
    },
    {
      "entropy": 0.158447265625,
      "epoch": 0.2035623409669211,
      "grad_norm": 56.411930084228516,
      "learning_rate": 4.0101522842639595e-06,
      "logits/chosen": -1.253394155349274,
      "logits/rejected": -1.2763997522602422,
      "logps/chosen": -219.5,
      "logps/rejected": -248.0,
      "loss": 0.6590461730957031,
      "mean_token_accuracy": 0.9516128301620483,
      "num_tokens": 15207602.0,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": -0.115966796875,
      "rewards/margins": 0.2529296875,
      "rewards/rejected": -0.3690185546875,
      "step": 40
    },
    {
      "entropy": 0.162109375,
      "epoch": 0.20865139949109415,
      "grad_norm": 50.47223663330078,
      "learning_rate": 3.984771573604061e-06,
      "logits/chosen": -1.221418931634342,
      "logits/rejected": -1.240179635098703,
      "logps/chosen": -198.75,
      "logps/rejected": -241.0,
      "loss": 0.61651611328125,
      "mean_token_accuracy": 0.9533202648162842,
      "num_tokens": 15615485.0,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.01708984375,
      "rewards/margins": 0.32470703125,
      "rewards/rejected": -0.3079833984375,
      "step": 41
    },
    {
      "entropy": 0.164794921875,
      "epoch": 0.21374045801526717,
      "grad_norm": 63.18607711791992,
      "learning_rate": 3.959390862944163e-06,
      "logits/chosen": -1.2487682814246732,
      "logits/rejected": -1.2684586865119198,
      "logps/chosen": -230.5,
      "logps/rejected": -251.25,
      "loss": 0.73516845703125,
      "mean_token_accuracy": 0.9500314593315125,
      "num_tokens": 16006587.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.0408935546875,
      "rewards/margins": 0.07275390625,
      "rewards/rejected": -0.11383056640625,
      "step": 42
    },
    {
      "entropy": 0.16796875,
      "epoch": 0.21882951653944022,
      "grad_norm": 57.65352249145508,
      "learning_rate": 3.934010152284265e-06,
      "logits/chosen": -1.3110932592597404,
      "logits/rejected": -1.3089875033252198,
      "logps/chosen": -223.0,
      "logps/rejected": -271.25,
      "loss": 0.7037353515625,
      "mean_token_accuracy": 0.952717587351799,
      "num_tokens": 16376034.0,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -0.1783447265625,
      "rewards/margins": 0.10040283203125,
      "rewards/rejected": -0.2783203125,
      "step": 43
    },
    {
      "entropy": 0.162353515625,
      "epoch": 0.22391857506361323,
      "grad_norm": 51.37344741821289,
      "learning_rate": 3.9086294416243655e-06,
      "logits/chosen": -1.293287887477467,
      "logits/rejected": -1.2826172419774333,
      "logps/chosen": -169.0,
      "logps/rejected": -188.25,
      "loss": 0.68048095703125,
      "mean_token_accuracy": 0.9513245075941086,
      "num_tokens": 16729880.0,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -0.14501953125,
      "rewards/margins": 0.17425537109375,
      "rewards/rejected": -0.31884765625,
      "step": 44
    },
    {
      "entropy": 0.162109375,
      "epoch": 0.22900763358778625,
      "grad_norm": 60.11509704589844,
      "learning_rate": 3.883248730964467e-06,
      "logits/chosen": -1.2668976340142997,
      "logits/rejected": -1.2750247764479736,
      "logps/chosen": -227.0,
      "logps/rejected": -250.0,
      "loss": 0.6617431640625,
      "mean_token_accuracy": 0.9519101679325104,
      "num_tokens": 17112685.0,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": -0.0929718017578125,
      "rewards/margins": 0.20703125,
      "rewards/rejected": -0.2998046875,
      "step": 45
    },
    {
      "entropy": 0.16552734375,
      "epoch": 0.2340966921119593,
      "grad_norm": 70.05858612060547,
      "learning_rate": 3.857868020304569e-06,
      "logits/chosen": -1.256115313351624,
      "logits/rejected": -1.292612336747009,
      "logps/chosen": -203.75,
      "logps/rejected": -204.25,
      "loss": 0.78472900390625,
      "mean_token_accuracy": 0.9469475299119949,
      "num_tokens": 17464688.0,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": -0.1900482177734375,
      "rewards/margins": -0.072418212890625,
      "rewards/rejected": -0.118408203125,
      "step": 46
    },
    {
      "entropy": 0.16552734375,
      "epoch": 0.23918575063613232,
      "grad_norm": 63.72059631347656,
      "learning_rate": 3.832487309644671e-06,
      "logits/chosen": -1.2366188823977582,
      "logits/rejected": -1.2068790190894856,
      "logps/chosen": -215.75,
      "logps/rejected": -216.25,
      "loss": 0.70928955078125,
      "mean_token_accuracy": 0.947726234793663,
      "num_tokens": 17827406.0,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -0.126556396484375,
      "rewards/margins": 0.05908203125,
      "rewards/rejected": -0.18597412109375,
      "step": 47
    },
    {
      "entropy": 0.173095703125,
      "epoch": 0.24427480916030533,
      "grad_norm": 51.02957534790039,
      "learning_rate": 3.8071065989847715e-06,
      "logits/chosen": -1.2951891338286738,
      "logits/rejected": -1.2901734123706725,
      "logps/chosen": -186.375,
      "logps/rejected": -190.375,
      "loss": 0.686798095703125,
      "mean_token_accuracy": 0.9495810121297836,
      "num_tokens": 18168837.0,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.149169921875,
      "rewards/margins": 0.10107421875,
      "rewards/rejected": -0.25054931640625,
      "step": 48
    },
    {
      "entropy": 0.171142578125,
      "epoch": 0.24936386768447838,
      "grad_norm": 65.16993713378906,
      "learning_rate": 3.7817258883248736e-06,
      "logits/chosen": -1.2489111246586129,
      "logits/rejected": -1.2595230297930642,
      "logps/chosen": -226.25,
      "logps/rejected": -253.5,
      "loss": 0.6953582763671875,
      "mean_token_accuracy": 0.9487173557281494,
      "num_tokens": 18520757.0,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": -0.05126953125,
      "rewards/margins": 0.1453857421875,
      "rewards/rejected": -0.197357177734375,
      "step": 49
    },
    {
      "entropy": 0.161865234375,
      "epoch": 0.2544529262086514,
      "grad_norm": 85.86858367919922,
      "learning_rate": 3.756345177664975e-06,
      "logits/chosen": -1.2788417924140663,
      "logits/rejected": -1.2818688140867107,
      "logps/chosen": -222.25,
      "logps/rejected": -228.0,
      "loss": 0.906097412109375,
      "mean_token_accuracy": 0.9481759369373322,
      "num_tokens": 18907465.0,
      "rewards/accuracies": 0.4375,
      "rewards/chosen": -0.32647705078125,
      "rewards/margins": -0.261962890625,
      "rewards/rejected": -0.06494140625,
      "step": 50
    }
  ],
  "logging_steps": 1,
  "max_steps": 197,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 1,
  "save_steps": 50,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 3.9987517381264015e+18,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}