PEFT
Safetensors
File size: 32,686 Bytes
d4f56a3
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.11157601115760112,
  "eval_steps": 300,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.0022315202231520223,
      "grad_norm": 11.248553276062012,
      "learning_rate": 4.444444444444445e-06,
      "logits/chosen": -0.48349103331565857,
      "logits/rejected": -0.652603030204773,
      "logps/chosen": -8.859519004821777,
      "logps/rejected": -16.016435623168945,
      "loss": 1.3468515872955322,
      "memory(GiB)": 33.34,
      "nll_loss": 0.6537042856216431,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 1,
      "train_speed(iter/s)": 0.010678
    },
    {
      "epoch": 0.004463040446304045,
      "grad_norm": 8.97808837890625,
      "learning_rate": 8.88888888888889e-06,
      "logits/chosen": -0.5174899101257324,
      "logits/rejected": -0.6262180805206299,
      "logps/chosen": -9.287378311157227,
      "logps/rejected": -13.981985092163086,
      "loss": 1.290852665901184,
      "memory(GiB)": 36.2,
      "nll_loss": 0.5977055430412292,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 2,
      "train_speed(iter/s)": 0.010974
    },
    {
      "epoch": 0.0066945606694560665,
      "grad_norm": 7.36937141418457,
      "learning_rate": 1.3333333333333333e-05,
      "logits/chosen": -0.42612141370773315,
      "logits/rejected": -0.6118584871292114,
      "logps/chosen": -6.56147575378418,
      "logps/rejected": -16.162681579589844,
      "loss": 1.1864153146743774,
      "memory(GiB)": 36.2,
      "nll_loss": 0.492550790309906,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -0.0009138870518654585,
      "rewards/margins": -0.0012306026183068752,
      "rewards/rejected": 0.00031671510078012943,
      "step": 3,
      "train_speed(iter/s)": 0.011052
    },
    {
      "epoch": 0.00892608089260809,
      "grad_norm": 7.918132305145264,
      "learning_rate": 1.777777777777778e-05,
      "logits/chosen": -0.5244420170783997,
      "logits/rejected": -0.6519989371299744,
      "logps/chosen": -7.461406707763672,
      "logps/rejected": -17.006786346435547,
      "loss": 1.3234074115753174,
      "memory(GiB)": 39.28,
      "nll_loss": 0.6342031359672546,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.0032776433508843184,
      "rewards/margins": 0.008089437149465084,
      "rewards/rejected": -0.004811794031411409,
      "step": 4,
      "train_speed(iter/s)": 0.011094
    },
    {
      "epoch": 0.011157601115760111,
      "grad_norm": 9.900442123413086,
      "learning_rate": 2.2222222222222223e-05,
      "logits/chosen": -0.5073186159133911,
      "logits/rejected": -0.6049282550811768,
      "logps/chosen": -7.057607650756836,
      "logps/rejected": -15.16832447052002,
      "loss": 1.071779489517212,
      "memory(GiB)": 39.28,
      "nll_loss": 0.40041351318359375,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.022623565047979355,
      "rewards/margins": 0.04467733949422836,
      "rewards/rejected": -0.02205377072095871,
      "step": 5,
      "train_speed(iter/s)": 0.011121
    },
    {
      "epoch": 0.013389121338912133,
      "grad_norm": 5.12174129486084,
      "learning_rate": 2.6666666666666667e-05,
      "logits/chosen": -0.48164039850234985,
      "logits/rejected": -0.5844419002532959,
      "logps/chosen": -6.2985005378723145,
      "logps/rejected": -16.83810043334961,
      "loss": 1.2731884717941284,
      "memory(GiB)": 39.28,
      "nll_loss": 0.600845992565155,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.010373853147029877,
      "rewards/margins": 0.046181634068489075,
      "rewards/rejected": -0.0358077809214592,
      "step": 6,
      "train_speed(iter/s)": 0.011143
    },
    {
      "epoch": 0.015620641562064157,
      "grad_norm": 4.1249213218688965,
      "learning_rate": 3.111111111111111e-05,
      "logits/chosen": -0.5566272735595703,
      "logits/rejected": -0.6051127910614014,
      "logps/chosen": -5.424515724182129,
      "logps/rejected": -11.893548011779785,
      "loss": 1.1159045696258545,
      "memory(GiB)": 39.28,
      "nll_loss": 0.46413302421569824,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.009653191082179546,
      "rewards/margins": 0.11444520205259323,
      "rewards/rejected": -0.10479200631380081,
      "step": 7,
      "train_speed(iter/s)": 0.011163
    },
    {
      "epoch": 0.01785216178521618,
      "grad_norm": 3.8928415775299072,
      "learning_rate": 3.555555555555556e-05,
      "logits/chosen": -0.5597310662269592,
      "logits/rejected": -0.6341894268989563,
      "logps/chosen": -6.350505352020264,
      "logps/rejected": -20.239299774169922,
      "loss": 0.8606890439987183,
      "memory(GiB)": 39.28,
      "nll_loss": 0.3352409899234772,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": -0.018700765445828438,
      "rewards/margins": 0.419380784034729,
      "rewards/rejected": -0.4380815923213959,
      "step": 8,
      "train_speed(iter/s)": 0.011179
    },
    {
      "epoch": 0.0200836820083682,
      "grad_norm": 7.264344692230225,
      "learning_rate": 4e-05,
      "logits/chosen": -0.500182569026947,
      "logits/rejected": -0.595187246799469,
      "logps/chosen": -16.194358825683594,
      "logps/rejected": -20.5479793548584,
      "loss": 1.6191558837890625,
      "memory(GiB)": 39.28,
      "nll_loss": 1.0435733795166016,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": -0.21446219086647034,
      "rewards/margins": 0.40107572078704834,
      "rewards/rejected": -0.6155378818511963,
      "step": 9,
      "train_speed(iter/s)": 0.011188
    },
    {
      "epoch": 0.022315202231520222,
      "grad_norm": 7.542423725128174,
      "learning_rate": 4.4444444444444447e-05,
      "logits/chosen": -0.41380318999290466,
      "logits/rejected": -0.5418319702148438,
      "logps/chosen": -10.30124568939209,
      "logps/rejected": -26.6314697265625,
      "loss": 1.2661710977554321,
      "memory(GiB)": 39.28,
      "nll_loss": 0.6692220568656921,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -0.29620301723480225,
      "rewards/margins": 0.5043031573295593,
      "rewards/rejected": -0.8005062341690063,
      "step": 10,
      "train_speed(iter/s)": 0.01119
    },
    {
      "epoch": 0.024546722454672244,
      "grad_norm": 12.055508613586426,
      "learning_rate": 4.888888888888889e-05,
      "logits/chosen": -0.45050907135009766,
      "logits/rejected": -0.5843921899795532,
      "logps/chosen": -15.530860900878906,
      "logps/rejected": -27.80389976501465,
      "loss": 1.6187087297439575,
      "memory(GiB)": 39.28,
      "nll_loss": 1.0532186031341553,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": -0.47808465361595154,
      "rewards/margins": 0.41364309191703796,
      "rewards/rejected": -0.8917278051376343,
      "step": 11,
      "train_speed(iter/s)": 0.011193
    },
    {
      "epoch": 0.026778242677824266,
      "grad_norm": 6.556560516357422,
      "learning_rate": 5.333333333333333e-05,
      "logits/chosen": -0.4449861943721771,
      "logits/rejected": -0.5602853894233704,
      "logps/chosen": -10.715709686279297,
      "logps/rejected": -27.810680389404297,
      "loss": 1.2998032569885254,
      "memory(GiB)": 42.68,
      "nll_loss": 0.6746751070022583,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": -0.33532828092575073,
      "rewards/margins": 0.39097556471824646,
      "rewards/rejected": -0.7263038754463196,
      "step": 12,
      "train_speed(iter/s)": 0.011193
    },
    {
      "epoch": 0.02900976290097629,
      "grad_norm": 6.815319061279297,
      "learning_rate": 5.7777777777777776e-05,
      "logits/chosen": -0.45461201667785645,
      "logits/rejected": -0.5696772933006287,
      "logps/chosen": -8.947586059570312,
      "logps/rejected": -23.452707290649414,
      "loss": 1.347914218902588,
      "memory(GiB)": 42.68,
      "nll_loss": 0.7918389439582825,
      "rewards/accuracies": 0.75,
      "rewards/chosen": -0.14807622134685516,
      "rewards/margins": 0.4436675012111664,
      "rewards/rejected": -0.5917437076568604,
      "step": 13,
      "train_speed(iter/s)": 0.011196
    },
    {
      "epoch": 0.031241283124128313,
      "grad_norm": 4.015015125274658,
      "learning_rate": 6.222222222222222e-05,
      "logits/chosen": -0.4277312457561493,
      "logits/rejected": -0.5162039995193481,
      "logps/chosen": -7.859683513641357,
      "logps/rejected": -25.14496612548828,
      "loss": 1.1709389686584473,
      "memory(GiB)": 46.13,
      "nll_loss": 0.5424311757087708,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.09304673224687576,
      "rewards/margins": 0.27104437351226807,
      "rewards/rejected": -0.36409106850624084,
      "step": 14,
      "train_speed(iter/s)": 0.011191
    },
    {
      "epoch": 0.03347280334728033,
      "grad_norm": 2.5992424488067627,
      "learning_rate": 6.666666666666667e-05,
      "logits/chosen": -0.4692430794239044,
      "logits/rejected": -0.5111399292945862,
      "logps/chosen": -8.574230194091797,
      "logps/rejected": -16.565174102783203,
      "loss": 1.1323829889297485,
      "memory(GiB)": 46.13,
      "nll_loss": 0.5113993287086487,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.08413823693990707,
      "rewards/margins": 0.19407325983047485,
      "rewards/rejected": -0.27821147441864014,
      "step": 15,
      "train_speed(iter/s)": 0.011195
    },
    {
      "epoch": 0.03570432357043236,
      "grad_norm": 2.479030132293701,
      "learning_rate": 7.111111111111112e-05,
      "logits/chosen": -0.38820019364356995,
      "logits/rejected": -0.5241715908050537,
      "logps/chosen": -4.694685935974121,
      "logps/rejected": -19.62047576904297,
      "loss": 1.052955985069275,
      "memory(GiB)": 46.13,
      "nll_loss": 0.47422000765800476,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.06994247436523438,
      "rewards/margins": 0.2729727327823639,
      "rewards/rejected": -0.2030302733182907,
      "step": 16,
      "train_speed(iter/s)": 0.011196
    },
    {
      "epoch": 0.03793584379358438,
      "grad_norm": 2.1875240802764893,
      "learning_rate": 7.555555555555556e-05,
      "logits/chosen": -0.4483625292778015,
      "logits/rejected": -0.5458305478096008,
      "logps/chosen": -9.014262199401855,
      "logps/rejected": -18.748149871826172,
      "loss": 1.2149709463119507,
      "memory(GiB)": 46.13,
      "nll_loss": 0.6185500621795654,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.1215842068195343,
      "rewards/margins": 0.24843284487724304,
      "rewards/rejected": -0.12684863805770874,
      "step": 17,
      "train_speed(iter/s)": 0.011197
    },
    {
      "epoch": 0.0401673640167364,
      "grad_norm": 2.639186382293701,
      "learning_rate": 8e-05,
      "logits/chosen": -0.4394489824771881,
      "logits/rejected": -0.48552829027175903,
      "logps/chosen": -9.954276084899902,
      "logps/rejected": -14.681390762329102,
      "loss": 1.1648714542388916,
      "memory(GiB)": 46.13,
      "nll_loss": 0.46223676204681396,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": 0.011617322452366352,
      "rewards/margins": 0.034979358315467834,
      "rewards/rejected": -0.02336202934384346,
      "step": 18,
      "train_speed(iter/s)": 0.011199
    },
    {
      "epoch": 0.042398884239888426,
      "grad_norm": 2.351567029953003,
      "learning_rate": 8.444444444444444e-05,
      "logits/chosen": -0.4882590174674988,
      "logits/rejected": -0.5300821661949158,
      "logps/chosen": -7.595667362213135,
      "logps/rejected": -17.29962921142578,
      "loss": 1.1524200439453125,
      "memory(GiB)": 46.13,
      "nll_loss": 0.5075826644897461,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.06894361972808838,
      "rewards/margins": 0.13017994165420532,
      "rewards/rejected": -0.061236318200826645,
      "step": 19,
      "train_speed(iter/s)": 0.011201
    },
    {
      "epoch": 0.044630404463040445,
      "grad_norm": 2.8206121921539307,
      "learning_rate": 8.888888888888889e-05,
      "logits/chosen": -0.4782502055168152,
      "logits/rejected": -0.5565172433853149,
      "logps/chosen": -6.507530212402344,
      "logps/rejected": -13.604747772216797,
      "loss": 1.089160442352295,
      "memory(GiB)": 46.13,
      "nll_loss": 0.45874831080436707,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": 0.06730557233095169,
      "rewards/margins": 0.18410882353782654,
      "rewards/rejected": -0.11680323630571365,
      "step": 20,
      "train_speed(iter/s)": 0.011206
    },
    {
      "epoch": 0.04686192468619247,
      "grad_norm": 2.452335834503174,
      "learning_rate": 9.333333333333334e-05,
      "logits/chosen": -0.4106925129890442,
      "logits/rejected": -0.48896345496177673,
      "logps/chosen": -7.722554683685303,
      "logps/rejected": -22.094852447509766,
      "loss": 1.153997540473938,
      "memory(GiB)": 46.71,
      "nll_loss": 0.5091268420219421,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.060057930648326874,
      "rewards/margins": 0.16068722307682037,
      "rewards/rejected": -0.1006293073296547,
      "step": 21,
      "train_speed(iter/s)": 0.011203
    },
    {
      "epoch": 0.04909344490934449,
      "grad_norm": 2.3324975967407227,
      "learning_rate": 9.777777777777778e-05,
      "logits/chosen": -0.4366399943828583,
      "logits/rejected": -0.4600733816623688,
      "logps/chosen": -9.774506568908691,
      "logps/rejected": -14.850456237792969,
      "loss": 1.185971975326538,
      "memory(GiB)": 46.71,
      "nll_loss": 0.5413804650306702,
      "rewards/accuracies": 0.5,
      "rewards/chosen": 0.08716820925474167,
      "rewards/margins": 0.17242644727230072,
      "rewards/rejected": -0.08525823801755905,
      "step": 22,
      "train_speed(iter/s)": 0.011203
    },
    {
      "epoch": 0.051324965132496514,
      "grad_norm": 2.7291500568389893,
      "learning_rate": 0.00010222222222222222,
      "logits/chosen": -0.4168204665184021,
      "logits/rejected": -0.5373830795288086,
      "logps/chosen": -7.675040245056152,
      "logps/rejected": -20.635356903076172,
      "loss": 1.1511971950531006,
      "memory(GiB)": 46.71,
      "nll_loss": 0.4784548282623291,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": 0.05419651046395302,
      "rewards/margins": 0.0959930419921875,
      "rewards/rejected": -0.04179652780294418,
      "step": 23,
      "train_speed(iter/s)": 0.011204
    },
    {
      "epoch": 0.05355648535564853,
      "grad_norm": 2.6357204914093018,
      "learning_rate": 0.00010666666666666667,
      "logits/chosen": -0.39612719416618347,
      "logits/rejected": -0.4547193944454193,
      "logps/chosen": -9.427398681640625,
      "logps/rejected": -20.611848831176758,
      "loss": 1.0459527969360352,
      "memory(GiB)": 46.71,
      "nll_loss": 0.42900872230529785,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.0577767938375473,
      "rewards/margins": 0.24017955362796783,
      "rewards/rejected": -0.18240275979042053,
      "step": 24,
      "train_speed(iter/s)": 0.011203
    },
    {
      "epoch": 0.05578800557880056,
      "grad_norm": 2.7458126544952393,
      "learning_rate": 0.00011111111111111112,
      "logits/chosen": -0.3978196978569031,
      "logits/rejected": -0.4898090958595276,
      "logps/chosen": -9.801487922668457,
      "logps/rejected": -21.7921199798584,
      "loss": 1.1577973365783691,
      "memory(GiB)": 46.71,
      "nll_loss": 0.5382578372955322,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.03896612673997879,
      "rewards/margins": 0.24017201364040375,
      "rewards/rejected": -0.20120586454868317,
      "step": 25,
      "train_speed(iter/s)": 0.011205
    },
    {
      "epoch": 0.05801952580195258,
      "grad_norm": 4.185514450073242,
      "learning_rate": 0.00011555555555555555,
      "logits/chosen": -0.43978849053382874,
      "logits/rejected": -0.5358645915985107,
      "logps/chosen": -4.664649963378906,
      "logps/rejected": -18.568632125854492,
      "loss": 0.9911558032035828,
      "memory(GiB)": 46.71,
      "nll_loss": 0.39514851570129395,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.01693350076675415,
      "rewards/margins": 0.28997230529785156,
      "rewards/rejected": -0.3069058060646057,
      "step": 26,
      "train_speed(iter/s)": 0.011208
    },
    {
      "epoch": 0.0602510460251046,
      "grad_norm": 2.983151912689209,
      "learning_rate": 0.00012,
      "logits/chosen": -0.46957868337631226,
      "logits/rejected": -0.5086190700531006,
      "logps/chosen": -14.16710376739502,
      "logps/rejected": -15.19424819946289,
      "loss": 1.3119632005691528,
      "memory(GiB)": 46.71,
      "nll_loss": 0.732680082321167,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.1205766424536705,
      "rewards/margins": 0.2763415277004242,
      "rewards/rejected": -0.1557648628950119,
      "step": 27,
      "train_speed(iter/s)": 0.01121
    },
    {
      "epoch": 0.06248256624825663,
      "grad_norm": 3.7991929054260254,
      "learning_rate": 0.00012444444444444444,
      "logits/chosen": -0.3287929892539978,
      "logits/rejected": -0.46299535036087036,
      "logps/chosen": -6.527912616729736,
      "logps/rejected": -23.983104705810547,
      "loss": 1.0033739805221558,
      "memory(GiB)": 46.71,
      "nll_loss": 0.44460976123809814,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.07841134071350098,
      "rewards/margins": 0.3698306679725647,
      "rewards/rejected": -0.29141926765441895,
      "step": 28,
      "train_speed(iter/s)": 0.011207
    },
    {
      "epoch": 0.06471408647140865,
      "grad_norm": 3.0063183307647705,
      "learning_rate": 0.00012888888888888892,
      "logits/chosen": -0.3735123574733734,
      "logits/rejected": -0.458845853805542,
      "logps/chosen": -7.325934886932373,
      "logps/rejected": -21.65030288696289,
      "loss": 1.0098869800567627,
      "memory(GiB)": 46.71,
      "nll_loss": 0.477042555809021,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.025919266045093536,
      "rewards/margins": 0.47939103841781616,
      "rewards/rejected": -0.4534717798233032,
      "step": 29,
      "train_speed(iter/s)": 0.011208
    },
    {
      "epoch": 0.06694560669456066,
      "grad_norm": 2.6957406997680664,
      "learning_rate": 0.00013333333333333334,
      "logits/chosen": -0.3790513873100281,
      "logits/rejected": -0.4815320372581482,
      "logps/chosen": -6.8280110359191895,
      "logps/rejected": -22.987621307373047,
      "loss": 1.0349267721176147,
      "memory(GiB)": 46.71,
      "nll_loss": 0.5045362114906311,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.09961891919374466,
      "rewards/margins": 0.4102502763271332,
      "rewards/rejected": -0.3106313645839691,
      "step": 30,
      "train_speed(iter/s)": 0.011209
    },
    {
      "epoch": 0.06917712691771269,
      "grad_norm": 2.7142391204833984,
      "learning_rate": 0.0001377777777777778,
      "logits/chosen": -0.36308056116104126,
      "logits/rejected": -0.44216084480285645,
      "logps/chosen": -5.850837230682373,
      "logps/rejected": -21.365463256835938,
      "loss": 0.9850523471832275,
      "memory(GiB)": 46.71,
      "nll_loss": 0.43448853492736816,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.0431375615298748,
      "rewards/margins": 0.3983423113822937,
      "rewards/rejected": -0.3552047610282898,
      "step": 31,
      "train_speed(iter/s)": 0.011211
    },
    {
      "epoch": 0.07140864714086471,
      "grad_norm": 3.897137403488159,
      "learning_rate": 0.00014222222222222224,
      "logits/chosen": -0.3979527950286865,
      "logits/rejected": -0.43778184056282043,
      "logps/chosen": -10.285924911499023,
      "logps/rejected": -18.7073974609375,
      "loss": 1.1233854293823242,
      "memory(GiB)": 46.71,
      "nll_loss": 0.5153944492340088,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.026699109002947807,
      "rewards/margins": 0.23945647478103638,
      "rewards/rejected": -0.21275737881660461,
      "step": 32,
      "train_speed(iter/s)": 0.011213
    },
    {
      "epoch": 0.07364016736401674,
      "grad_norm": 3.93380069732666,
      "learning_rate": 0.00014666666666666666,
      "logits/chosen": -0.2758394777774811,
      "logits/rejected": -0.37545740604400635,
      "logps/chosen": -12.159762382507324,
      "logps/rejected": -24.926610946655273,
      "loss": 1.2487003803253174,
      "memory(GiB)": 46.71,
      "nll_loss": 0.6138952970504761,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.09166956692934036,
      "rewards/margins": 0.2808037996292114,
      "rewards/rejected": -0.3724733591079712,
      "step": 33,
      "train_speed(iter/s)": 0.011211
    },
    {
      "epoch": 0.07587168758716877,
      "grad_norm": 3.21878981590271,
      "learning_rate": 0.0001511111111111111,
      "logits/chosen": -0.24420826137065887,
      "logits/rejected": -0.38765522837638855,
      "logps/chosen": -6.041399955749512,
      "logps/rejected": -22.503984451293945,
      "loss": 0.9895752668380737,
      "memory(GiB)": 46.71,
      "nll_loss": 0.44009482860565186,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.010253368876874447,
      "rewards/margins": 0.5208209753036499,
      "rewards/rejected": -0.5105676054954529,
      "step": 34,
      "train_speed(iter/s)": 0.01121
    },
    {
      "epoch": 0.07810320781032078,
      "grad_norm": 5.1504316329956055,
      "learning_rate": 0.00015555555555555556,
      "logits/chosen": -0.2664889693260193,
      "logits/rejected": -0.40212178230285645,
      "logps/chosen": -5.9132609367370605,
      "logps/rejected": -24.527639389038086,
      "loss": 0.8355879187583923,
      "memory(GiB)": 46.71,
      "nll_loss": 0.4006969928741455,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": -0.03980417177081108,
      "rewards/margins": 0.8774286508560181,
      "rewards/rejected": -0.9172328114509583,
      "step": 35,
      "train_speed(iter/s)": 0.011211
    },
    {
      "epoch": 0.0803347280334728,
      "grad_norm": 3.388197660446167,
      "learning_rate": 0.00016,
      "logits/chosen": -0.25354304909706116,
      "logits/rejected": -0.33330878615379333,
      "logps/chosen": -9.807186126708984,
      "logps/rejected": -22.963045120239258,
      "loss": 1.1024540662765503,
      "memory(GiB)": 46.71,
      "nll_loss": 0.6454060673713684,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": -0.001722879707813263,
      "rewards/margins": 0.8297844529151917,
      "rewards/rejected": -0.8315073847770691,
      "step": 36,
      "train_speed(iter/s)": 0.011211
    },
    {
      "epoch": 0.08256624825662483,
      "grad_norm": 2.596273899078369,
      "learning_rate": 0.00016444444444444444,
      "logits/chosen": -0.21093566715717316,
      "logits/rejected": -0.3617200553417206,
      "logps/chosen": -2.8380072116851807,
      "logps/rejected": -30.42251968383789,
      "loss": 0.6882003545761108,
      "memory(GiB)": 46.71,
      "nll_loss": 0.2877930700778961,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.06296033412218094,
      "rewards/margins": 1.0582321882247925,
      "rewards/rejected": -0.9952719211578369,
      "step": 37,
      "train_speed(iter/s)": 0.01121
    },
    {
      "epoch": 0.08479776847977685,
      "grad_norm": 2.358452796936035,
      "learning_rate": 0.00016888888888888889,
      "logits/chosen": -0.2989475429058075,
      "logits/rejected": -0.37469911575317383,
      "logps/chosen": -6.1970534324646,
      "logps/rejected": -19.100358963012695,
      "loss": 0.8981406092643738,
      "memory(GiB)": 46.71,
      "nll_loss": 0.3934318423271179,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.002394435927271843,
      "rewards/margins": 0.6755657196044922,
      "rewards/rejected": -0.6731712818145752,
      "step": 38,
      "train_speed(iter/s)": 0.011211
    },
    {
      "epoch": 0.08702928870292886,
      "grad_norm": 2.9299051761627197,
      "learning_rate": 0.00017333333333333334,
      "logits/chosen": -0.2796667516231537,
      "logits/rejected": -0.34129300713539124,
      "logps/chosen": -8.498173713684082,
      "logps/rejected": -26.264965057373047,
      "loss": 1.012364387512207,
      "memory(GiB)": 46.71,
      "nll_loss": 0.586083173751831,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.07207094132900238,
      "rewards/margins": 1.1341111660003662,
      "rewards/rejected": -1.0620403289794922,
      "step": 39,
      "train_speed(iter/s)": 0.011212
    },
    {
      "epoch": 0.08926080892608089,
      "grad_norm": 3.547189474105835,
      "learning_rate": 0.00017777777777777779,
      "logits/chosen": -0.28194305300712585,
      "logits/rejected": -0.33060967922210693,
      "logps/chosen": -7.982609748840332,
      "logps/rejected": -20.187652587890625,
      "loss": 0.9403265118598938,
      "memory(GiB)": 46.71,
      "nll_loss": 0.42783123254776,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.002833280712366104,
      "rewards/margins": 0.7690448760986328,
      "rewards/rejected": -0.7662116289138794,
      "step": 40,
      "train_speed(iter/s)": 0.011213
    },
    {
      "epoch": 0.09149232914923291,
      "grad_norm": 3.4967706203460693,
      "learning_rate": 0.00018222222222222224,
      "logits/chosen": -0.21270643174648285,
      "logits/rejected": -0.3004887104034424,
      "logps/chosen": -5.226779937744141,
      "logps/rejected": -22.208778381347656,
      "loss": 0.8620257377624512,
      "memory(GiB)": 46.71,
      "nll_loss": 0.3914262056350708,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.018529795110225677,
      "rewards/margins": 0.9286664128303528,
      "rewards/rejected": -0.9101365804672241,
      "step": 41,
      "train_speed(iter/s)": 0.011213
    },
    {
      "epoch": 0.09372384937238494,
      "grad_norm": 6.100057601928711,
      "learning_rate": 0.0001866666666666667,
      "logits/chosen": -0.29974937438964844,
      "logits/rejected": -0.36353808641433716,
      "logps/chosen": -10.446137428283691,
      "logps/rejected": -22.973119735717773,
      "loss": 1.2477580308914185,
      "memory(GiB)": 46.71,
      "nll_loss": 0.6882976293563843,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -0.2526606023311615,
      "rewards/margins": 0.5461662411689758,
      "rewards/rejected": -0.7988268136978149,
      "step": 42,
      "train_speed(iter/s)": 0.011214
    },
    {
      "epoch": 0.09595536959553697,
      "grad_norm": 4.625721454620361,
      "learning_rate": 0.00019111111111111114,
      "logits/chosen": -0.21875600516796112,
      "logits/rejected": -0.3691503405570984,
      "logps/chosen": -8.029109001159668,
      "logps/rejected": -33.986671447753906,
      "loss": 0.9927695989608765,
      "memory(GiB)": 46.71,
      "nll_loss": 0.6190873384475708,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": -0.10942590236663818,
      "rewards/margins": 1.7278107404708862,
      "rewards/rejected": -1.837236762046814,
      "step": 43,
      "train_speed(iter/s)": 0.011215
    },
    {
      "epoch": 0.09818688981868898,
      "grad_norm": 4.994227886199951,
      "learning_rate": 0.00019555555555555556,
      "logits/chosen": -0.25192195177078247,
      "logits/rejected": -0.32522761821746826,
      "logps/chosen": -9.805305480957031,
      "logps/rejected": -34.161895751953125,
      "loss": 0.9997942447662354,
      "memory(GiB)": 46.71,
      "nll_loss": 0.6020480990409851,
      "rewards/accuracies": 0.75,
      "rewards/chosen": -0.30676746368408203,
      "rewards/margins": 1.7450387477874756,
      "rewards/rejected": -2.0518062114715576,
      "step": 44,
      "train_speed(iter/s)": 0.011214
    },
    {
      "epoch": 0.100418410041841,
      "grad_norm": 4.717008590698242,
      "learning_rate": 0.0002,
      "logits/chosen": -0.33617067337036133,
      "logits/rejected": -0.35846105217933655,
      "logps/chosen": -9.175792694091797,
      "logps/rejected": -21.536231994628906,
      "loss": 1.014683485031128,
      "memory(GiB)": 46.71,
      "nll_loss": 0.5040097236633301,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.014129618182778358,
      "rewards/margins": 0.7111825942993164,
      "rewards/rejected": -0.6970530152320862,
      "step": 45,
      "train_speed(iter/s)": 0.011215
    },
    {
      "epoch": 0.10264993026499303,
      "grad_norm": 3.089895248413086,
      "learning_rate": 0.0001999993185874369,
      "logits/chosen": -0.3643554747104645,
      "logits/rejected": -0.3828020393848419,
      "logps/chosen": -11.385210990905762,
      "logps/rejected": -27.30405044555664,
      "loss": 0.9333115220069885,
      "memory(GiB)": 46.71,
      "nll_loss": 0.5031883120536804,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.08416246622800827,
      "rewards/margins": 1.1319228410720825,
      "rewards/rejected": -1.216085433959961,
      "step": 46,
      "train_speed(iter/s)": 0.011215
    },
    {
      "epoch": 0.10488145048814505,
      "grad_norm": 4.295483589172363,
      "learning_rate": 0.00019999727435903407,
      "logits/chosen": -0.3375833332538605,
      "logits/rejected": -0.44685542583465576,
      "logps/chosen": -4.36940336227417,
      "logps/rejected": -21.149555206298828,
      "loss": 0.959221601486206,
      "memory(GiB)": 46.71,
      "nll_loss": 0.42982059717178345,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.15477100014686584,
      "rewards/margins": 0.5941969752311707,
      "rewards/rejected": -0.4394259452819824,
      "step": 47,
      "train_speed(iter/s)": 0.011216
    },
    {
      "epoch": 0.10711297071129706,
      "grad_norm": 2.4132261276245117,
      "learning_rate": 0.0001999938673426507,
      "logits/chosen": -0.3103625178337097,
      "logits/rejected": -0.4320617616176605,
      "logps/chosen": -5.777155876159668,
      "logps/rejected": -20.897228240966797,
      "loss": 0.9094122648239136,
      "memory(GiB)": 46.71,
      "nll_loss": 0.41829684376716614,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.18217116594314575,
      "rewards/margins": 0.714988112449646,
      "rewards/rejected": -0.5328169465065002,
      "step": 48,
      "train_speed(iter/s)": 0.011216
    },
    {
      "epoch": 0.10934449093444909,
      "grad_norm": 2.716282367706299,
      "learning_rate": 0.00019998909758471852,
      "logits/chosen": -0.3802068829536438,
      "logits/rejected": -0.4424472749233246,
      "logps/chosen": -7.844504356384277,
      "logps/rejected": -21.755281448364258,
      "loss": 1.0127230882644653,
      "memory(GiB)": 46.71,
      "nll_loss": 0.5032894611358643,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.07639233767986298,
      "rewards/margins": 0.79319167137146,
      "rewards/rejected": -0.7167993187904358,
      "step": 49,
      "train_speed(iter/s)": 0.011217
    },
    {
      "epoch": 0.11157601115760112,
      "grad_norm": 3.5755205154418945,
      "learning_rate": 0.000199982965150241,
      "logits/chosen": -0.32785969972610474,
      "logits/rejected": -0.384295791387558,
      "logps/chosen": -12.152947425842285,
      "logps/rejected": -21.354625701904297,
      "loss": 1.1883673667907715,
      "memory(GiB)": 46.71,
      "nll_loss": 0.6465156674385071,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.11994989961385727,
      "rewards/margins": 0.5093130469322205,
      "rewards/rejected": -0.6292628645896912,
      "step": 50,
      "train_speed(iter/s)": 0.011217
    }
  ],
  "logging_steps": 1,
  "max_steps": 896,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 2,
  "save_steps": 50,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 2.728739939863757e+16,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}