PEFT
Safetensors
File size: 32,186 Bytes
7059b5c
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.09466895449973374,
  "eval_steps": 300,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.0018933790899946748,
      "grad_norm": 12.48285961151123,
      "learning_rate": 2.5e-06,
      "logits/chosen": -0.600911557674408,
      "logits/rejected": -0.6057144403457642,
      "logps/chosen": -8.623997688293457,
      "logps/rejected": -21.27922248840332,
      "loss": 1.5083240270614624,
      "memory(GiB)": 45.96,
      "nll_loss": 0.8151768445968628,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 1,
      "train_speed(iter/s)": 0.005677
    },
    {
      "epoch": 0.0037867581799893497,
      "grad_norm": 12.232138633728027,
      "learning_rate": 5e-06,
      "logits/chosen": -0.6421620845794678,
      "logits/rejected": -0.6454498767852783,
      "logps/chosen": -10.60006046295166,
      "logps/rejected": -13.605328559875488,
      "loss": 1.547582983970642,
      "memory(GiB)": 45.96,
      "nll_loss": 0.8544361591339111,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 2,
      "train_speed(iter/s)": 0.005654
    },
    {
      "epoch": 0.005680137269984025,
      "grad_norm": 14.417566299438477,
      "learning_rate": 7.5e-06,
      "logits/chosen": -0.664191484451294,
      "logits/rejected": -0.6654082536697388,
      "logps/chosen": -11.958788871765137,
      "logps/rejected": -13.785713195800781,
      "loss": 1.6179333925247192,
      "memory(GiB)": 45.96,
      "nll_loss": 0.9271513819694519,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.003109893761575222,
      "rewards/margins": 0.0048811971209943295,
      "rewards/rejected": -0.0017713033594191074,
      "step": 3,
      "train_speed(iter/s)": 0.005618
    },
    {
      "epoch": 0.007573516359978699,
      "grad_norm": 8.840044975280762,
      "learning_rate": 1e-05,
      "logits/chosen": -0.6362882256507874,
      "logits/rejected": -0.6385632753372192,
      "logps/chosen": -9.689570426940918,
      "logps/rejected": -18.226909637451172,
      "loss": 1.4001612663269043,
      "memory(GiB)": 45.96,
      "nll_loss": 0.7101836204528809,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.005959533154964447,
      "rewards/margins": 0.00653040548786521,
      "rewards/rejected": -0.0005708730313926935,
      "step": 4,
      "train_speed(iter/s)": 0.005654
    },
    {
      "epoch": 0.009466895449973374,
      "grad_norm": 12.643730163574219,
      "learning_rate": 1.25e-05,
      "logits/chosen": -0.6108935475349426,
      "logits/rejected": -0.6125737428665161,
      "logps/chosen": -10.900370597839355,
      "logps/rejected": -16.267436981201172,
      "loss": 1.5408352613449097,
      "memory(GiB)": 45.96,
      "nll_loss": 0.853638768196106,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.018230972811579704,
      "rewards/margins": 0.01212537381798029,
      "rewards/rejected": 0.006105600390583277,
      "step": 5,
      "train_speed(iter/s)": 0.005633
    },
    {
      "epoch": 0.01136027453996805,
      "grad_norm": 13.595820426940918,
      "learning_rate": 1.5e-05,
      "logits/chosen": -0.6641858220100403,
      "logits/rejected": -0.6705058217048645,
      "logps/chosen": -7.528585910797119,
      "logps/rejected": -18.073911666870117,
      "loss": 1.4404857158660889,
      "memory(GiB)": 45.96,
      "nll_loss": 0.7598920464515686,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.034823305904865265,
      "rewards/margins": 0.026311496272683144,
      "rewards/rejected": 0.008511810563504696,
      "step": 6,
      "train_speed(iter/s)": 0.005634
    },
    {
      "epoch": 0.013253653629962723,
      "grad_norm": 13.2615385055542,
      "learning_rate": 1.75e-05,
      "logits/chosen": -0.6327687501907349,
      "logits/rejected": -0.637922465801239,
      "logps/chosen": -8.100177764892578,
      "logps/rejected": -22.4697322845459,
      "loss": 1.310943603515625,
      "memory(GiB)": 45.96,
      "nll_loss": 0.6429428458213806,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.07164613902568817,
      "rewards/margins": 0.053715869784355164,
      "rewards/rejected": 0.017930276691913605,
      "step": 7,
      "train_speed(iter/s)": 0.005641
    },
    {
      "epoch": 0.015147032719957399,
      "grad_norm": 9.518823623657227,
      "learning_rate": 2e-05,
      "logits/chosen": -0.6458379626274109,
      "logits/rejected": -0.6480465531349182,
      "logps/chosen": -8.227258682250977,
      "logps/rejected": -15.074575424194336,
      "loss": 1.2895722389221191,
      "memory(GiB)": 45.96,
      "nll_loss": 0.6121883392333984,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": 0.11458335816860199,
      "rewards/margins": 0.04461951553821564,
      "rewards/rejected": 0.06996384263038635,
      "step": 8,
      "train_speed(iter/s)": 0.005657
    },
    {
      "epoch": 0.017040411809952073,
      "grad_norm": 5.971006393432617,
      "learning_rate": 2.25e-05,
      "logits/chosen": -0.6322387456893921,
      "logits/rejected": -0.6355814933776855,
      "logps/chosen": -6.8561859130859375,
      "logps/rejected": -16.394319534301758,
      "loss": 1.1358637809753418,
      "memory(GiB)": 45.96,
      "nll_loss": 0.4396786093711853,
      "rewards/accuracies": 0.5,
      "rewards/chosen": 0.126601442694664,
      "rewards/margins": 0.027468431740999222,
      "rewards/rejected": 0.09913301467895508,
      "step": 9,
      "train_speed(iter/s)": 0.005656
    },
    {
      "epoch": 0.018933790899946748,
      "grad_norm": 4.615151405334473,
      "learning_rate": 2.5e-05,
      "logits/chosen": -0.6353996992111206,
      "logits/rejected": -0.6420772075653076,
      "logps/chosen": -4.39181661605835,
      "logps/rejected": -19.73300552368164,
      "loss": 0.98687344789505,
      "memory(GiB)": 45.96,
      "nll_loss": 0.38576164841651917,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.196926087141037,
      "rewards/margins": 0.274502158164978,
      "rewards/rejected": -0.07757607102394104,
      "step": 10,
      "train_speed(iter/s)": 0.005651
    },
    {
      "epoch": 0.020827169989941424,
      "grad_norm": 3.6985604763031006,
      "learning_rate": 2.7500000000000004e-05,
      "logits/chosen": -0.6321280002593994,
      "logits/rejected": -0.6365548968315125,
      "logps/chosen": -7.2246904373168945,
      "logps/rejected": -19.404216766357422,
      "loss": 0.9879567623138428,
      "memory(GiB)": 45.96,
      "nll_loss": 0.36671119928359985,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.12358222156763077,
      "rewards/margins": 0.28244268894195557,
      "rewards/rejected": -0.1588604599237442,
      "step": 11,
      "train_speed(iter/s)": 0.005662
    },
    {
      "epoch": 0.0227205490799361,
      "grad_norm": 7.83486270904541,
      "learning_rate": 3e-05,
      "logits/chosen": -0.6391905546188354,
      "logits/rejected": -0.6451292634010315,
      "logps/chosen": -8.3941011428833,
      "logps/rejected": -24.687467575073242,
      "loss": 1.1386761665344238,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3862188458442688,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -0.004531089216470718,
      "rewards/margins": 0.17587248980998993,
      "rewards/rejected": -0.18040357530117035,
      "step": 12,
      "train_speed(iter/s)": 0.005646
    },
    {
      "epoch": 0.024613928169930775,
      "grad_norm": 5.917618274688721,
      "learning_rate": 3.2500000000000004e-05,
      "logits/chosen": -0.6517987251281738,
      "logits/rejected": -0.658316969871521,
      "logps/chosen": -6.573670387268066,
      "logps/rejected": -19.874000549316406,
      "loss": 1.050663948059082,
      "memory(GiB)": 45.96,
      "nll_loss": 0.40407559275627136,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.10255793482065201,
      "rewards/margins": 0.36497071385383606,
      "rewards/rejected": -0.26241275668144226,
      "step": 13,
      "train_speed(iter/s)": 0.00565
    },
    {
      "epoch": 0.026507307259925447,
      "grad_norm": 4.1237287521362305,
      "learning_rate": 3.5e-05,
      "logits/chosen": -0.61805260181427,
      "logits/rejected": -0.6224305033683777,
      "logps/chosen": -5.8840789794921875,
      "logps/rejected": -29.290557861328125,
      "loss": 0.9034114480018616,
      "memory(GiB)": 45.96,
      "nll_loss": 0.33107179403305054,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.13439905643463135,
      "rewards/margins": 0.5032773017883301,
      "rewards/rejected": -0.36887818574905396,
      "step": 14,
      "train_speed(iter/s)": 0.005633
    },
    {
      "epoch": 0.028400686349920122,
      "grad_norm": 2.141984701156616,
      "learning_rate": 3.7500000000000003e-05,
      "logits/chosen": -0.6251233816146851,
      "logits/rejected": -0.6291872262954712,
      "logps/chosen": -5.3556623458862305,
      "logps/rejected": -22.30205535888672,
      "loss": 0.7756511569023132,
      "memory(GiB)": 45.96,
      "nll_loss": 0.22363990545272827,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.21060410141944885,
      "rewards/margins": 0.5203964710235596,
      "rewards/rejected": -0.30979233980178833,
      "step": 15,
      "train_speed(iter/s)": 0.005622
    },
    {
      "epoch": 0.030294065439914798,
      "grad_norm": 6.157620906829834,
      "learning_rate": 4e-05,
      "logits/chosen": -0.6184762716293335,
      "logits/rejected": -0.6184364557266235,
      "logps/chosen": -10.368714332580566,
      "logps/rejected": -12.033210754394531,
      "loss": 1.4029701948165894,
      "memory(GiB)": 45.96,
      "nll_loss": 0.6103286743164062,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.020060203969478607,
      "rewards/margins": -0.03359239548444748,
      "rewards/rejected": 0.013532169163227081,
      "step": 16,
      "train_speed(iter/s)": 0.005624
    },
    {
      "epoch": 0.03218744452990947,
      "grad_norm": 2.690070152282715,
      "learning_rate": 4.25e-05,
      "logits/chosen": -0.6329092383384705,
      "logits/rejected": -0.6367439031600952,
      "logps/chosen": -6.010343551635742,
      "logps/rejected": -17.85470199584961,
      "loss": 0.8949607610702515,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3054018020629883,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.25051170587539673,
      "rewards/margins": 0.37515202164649963,
      "rewards/rejected": -0.12464030832052231,
      "step": 17,
      "train_speed(iter/s)": 0.00562
    },
    {
      "epoch": 0.034080823619904145,
      "grad_norm": 2.8276467323303223,
      "learning_rate": 4.5e-05,
      "logits/chosen": -0.6264123320579529,
      "logits/rejected": -0.6279273629188538,
      "logps/chosen": -9.41238021850586,
      "logps/rejected": -18.639442443847656,
      "loss": 1.0180559158325195,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3220836818218231,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.1841900646686554,
      "rewards/margins": 0.13813874125480652,
      "rewards/rejected": 0.04605132341384888,
      "step": 18,
      "train_speed(iter/s)": 0.005619
    },
    {
      "epoch": 0.035974202709898824,
      "grad_norm": 2.10530161857605,
      "learning_rate": 4.75e-05,
      "logits/chosen": -0.6376557946205139,
      "logits/rejected": -0.6416239738464355,
      "logps/chosen": -5.7143964767456055,
      "logps/rejected": -16.784849166870117,
      "loss": 0.9154303669929504,
      "memory(GiB)": 45.96,
      "nll_loss": 0.2545720934867859,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.24181872606277466,
      "rewards/margins": 0.18784700334072113,
      "rewards/rejected": 0.05397173762321472,
      "step": 19,
      "train_speed(iter/s)": 0.00562
    },
    {
      "epoch": 0.037867581799893496,
      "grad_norm": 2.357306480407715,
      "learning_rate": 5e-05,
      "logits/chosen": -0.6326904296875,
      "logits/rejected": -0.6354666352272034,
      "logps/chosen": -5.867492198944092,
      "logps/rejected": -13.818038940429688,
      "loss": 0.9468417167663574,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3124926686286926,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.3217320740222931,
      "rewards/margins": 0.22124268114566803,
      "rewards/rejected": 0.10048942267894745,
      "step": 20,
      "train_speed(iter/s)": 0.005628
    },
    {
      "epoch": 0.039760960889888175,
      "grad_norm": 2.5859196186065674,
      "learning_rate": 5.25e-05,
      "logits/chosen": -0.6597320437431335,
      "logits/rejected": -0.6610896587371826,
      "logps/chosen": -7.943680286407471,
      "logps/rejected": -11.634421348571777,
      "loss": 1.0064345598220825,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3732220232486725,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.3646732270717621,
      "rewards/margins": 0.21462492644786835,
      "rewards/rejected": 0.15004827082157135,
      "step": 21,
      "train_speed(iter/s)": 0.005624
    },
    {
      "epoch": 0.04165433997988285,
      "grad_norm": 2.20487642288208,
      "learning_rate": 5.500000000000001e-05,
      "logits/chosen": -0.6439244151115417,
      "logits/rejected": -0.6464219093322754,
      "logps/chosen": -4.180229187011719,
      "logps/rejected": -19.56499481201172,
      "loss": 0.9136227369308472,
      "memory(GiB)": 45.96,
      "nll_loss": 0.22558730840682983,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": 0.25369688868522644,
      "rewards/margins": 0.14792592823505402,
      "rewards/rejected": 0.10577096790075302,
      "step": 22,
      "train_speed(iter/s)": 0.00562
    },
    {
      "epoch": 0.04354771906987752,
      "grad_norm": 2.80965518951416,
      "learning_rate": 5.7499999999999995e-05,
      "logits/chosen": -0.5748096108436584,
      "logits/rejected": -0.5799225568771362,
      "logps/chosen": -5.921882629394531,
      "logps/rejected": -22.432538986206055,
      "loss": 0.9860997796058655,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3462521731853485,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.24639810621738434,
      "rewards/margins": 0.1898707151412964,
      "rewards/rejected": 0.05652741342782974,
      "step": 23,
      "train_speed(iter/s)": 0.005621
    },
    {
      "epoch": 0.0454410981598722,
      "grad_norm": 2.9503355026245117,
      "learning_rate": 6e-05,
      "logits/chosen": -0.6007645726203918,
      "logits/rejected": -0.6086101531982422,
      "logps/chosen": -5.338952541351318,
      "logps/rejected": -26.883895874023438,
      "loss": 0.9453619122505188,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3667706847190857,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.392182856798172,
      "rewards/margins": 0.36902523040771484,
      "rewards/rejected": 0.02315761335194111,
      "step": 24,
      "train_speed(iter/s)": 0.005624
    },
    {
      "epoch": 0.04733447724986687,
      "grad_norm": 2.2843515872955322,
      "learning_rate": 6.25e-05,
      "logits/chosen": -0.6047165393829346,
      "logits/rejected": -0.608917772769928,
      "logps/chosen": -6.276377201080322,
      "logps/rejected": -21.095470428466797,
      "loss": 0.914051353931427,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3292374610900879,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.3036147356033325,
      "rewards/margins": 0.32923099398612976,
      "rewards/rejected": -0.025616232305765152,
      "step": 25,
      "train_speed(iter/s)": 0.005617
    },
    {
      "epoch": 0.04922785633986155,
      "grad_norm": 2.7294957637786865,
      "learning_rate": 6.500000000000001e-05,
      "logits/chosen": -0.6337023377418518,
      "logits/rejected": -0.6374361515045166,
      "logps/chosen": -7.032902240753174,
      "logps/rejected": -24.937816619873047,
      "loss": 0.8451516032218933,
      "memory(GiB)": 45.96,
      "nll_loss": 0.25359871983528137,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.24989479780197144,
      "rewards/margins": 0.3727536201477051,
      "rewards/rejected": -0.12285882234573364,
      "step": 26,
      "train_speed(iter/s)": 0.005618
    },
    {
      "epoch": 0.05112123542985622,
      "grad_norm": 1.9816867113113403,
      "learning_rate": 6.750000000000001e-05,
      "logits/chosen": -0.6674913167953491,
      "logits/rejected": -0.6716790795326233,
      "logps/chosen": -3.894029378890991,
      "logps/rejected": -19.461292266845703,
      "loss": 0.720669686794281,
      "memory(GiB)": 45.96,
      "nll_loss": 0.1943943053483963,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.40334552526474,
      "rewards/margins": 0.5223954319953918,
      "rewards/rejected": -0.11904986202716827,
      "step": 27,
      "train_speed(iter/s)": 0.005612
    },
    {
      "epoch": 0.05301461451985089,
      "grad_norm": 1.9561638832092285,
      "learning_rate": 7e-05,
      "logits/chosen": -0.6560395359992981,
      "logits/rejected": -0.6615370512008667,
      "logps/chosen": -3.828300952911377,
      "logps/rejected": -27.646583557128906,
      "loss": 0.7324035167694092,
      "memory(GiB)": 45.96,
      "nll_loss": 0.18986308574676514,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.2855417728424072,
      "rewards/margins": 0.5658388733863831,
      "rewards/rejected": -0.28029707074165344,
      "step": 28,
      "train_speed(iter/s)": 0.005609
    },
    {
      "epoch": 0.05490799360984557,
      "grad_norm": 2.197960376739502,
      "learning_rate": 7.25e-05,
      "logits/chosen": -0.6013461351394653,
      "logits/rejected": -0.6078683733940125,
      "logps/chosen": -5.841001987457275,
      "logps/rejected": -28.59882926940918,
      "loss": 0.763361930847168,
      "memory(GiB)": 45.96,
      "nll_loss": 0.29682645201683044,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.33854252099990845,
      "rewards/margins": 0.7552333474159241,
      "rewards/rejected": -0.416690856218338,
      "step": 29,
      "train_speed(iter/s)": 0.005603
    },
    {
      "epoch": 0.056801372699840244,
      "grad_norm": 4.102924823760986,
      "learning_rate": 7.500000000000001e-05,
      "logits/chosen": -0.6362655758857727,
      "logits/rejected": -0.6371059417724609,
      "logps/chosen": -6.047646522521973,
      "logps/rejected": -16.402286529541016,
      "loss": 0.930861234664917,
      "memory(GiB)": 45.96,
      "nll_loss": 0.33219844102859497,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.2280413955450058,
      "rewards/margins": 0.48401153087615967,
      "rewards/rejected": -0.25597015023231506,
      "step": 30,
      "train_speed(iter/s)": 0.005604
    },
    {
      "epoch": 0.05869475178983492,
      "grad_norm": 2.643806219100952,
      "learning_rate": 7.75e-05,
      "logits/chosen": -0.6917952299118042,
      "logits/rejected": -0.6954830884933472,
      "logps/chosen": -4.5008368492126465,
      "logps/rejected": -25.313228607177734,
      "loss": 0.7698233127593994,
      "memory(GiB)": 45.96,
      "nll_loss": 0.21702390909194946,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.2267376184463501,
      "rewards/margins": 0.6824056506156921,
      "rewards/rejected": -0.4556680917739868,
      "step": 31,
      "train_speed(iter/s)": 0.005603
    },
    {
      "epoch": 0.060588130879829595,
      "grad_norm": 3.9089903831481934,
      "learning_rate": 8e-05,
      "logits/chosen": -0.6848002672195435,
      "logits/rejected": -0.6877056360244751,
      "logps/chosen": -9.047338485717773,
      "logps/rejected": -25.891061782836914,
      "loss": 0.9844011068344116,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3213033378124237,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.13390681147575378,
      "rewards/margins": 0.6111294031143188,
      "rewards/rejected": -0.4772225618362427,
      "step": 32,
      "train_speed(iter/s)": 0.005603
    },
    {
      "epoch": 0.062481509969824274,
      "grad_norm": 3.631053924560547,
      "learning_rate": 8.25e-05,
      "logits/chosen": -0.6787916421890259,
      "logits/rejected": -0.681725025177002,
      "logps/chosen": -11.23558521270752,
      "logps/rejected": -24.226280212402344,
      "loss": 1.1201726198196411,
      "memory(GiB)": 45.96,
      "nll_loss": 0.5571246147155762,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.2192046195268631,
      "rewards/margins": 0.6016167402267456,
      "rewards/rejected": -0.3824121356010437,
      "step": 33,
      "train_speed(iter/s)": 0.00561
    },
    {
      "epoch": 0.06437488905981895,
      "grad_norm": 2.667919158935547,
      "learning_rate": 8.5e-05,
      "logits/chosen": -0.7005462646484375,
      "logits/rejected": -0.7055037021636963,
      "logps/chosen": -3.1784541606903076,
      "logps/rejected": -23.535545349121094,
      "loss": 0.638558566570282,
      "memory(GiB)": 45.96,
      "nll_loss": 0.23515944182872772,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.27606871724128723,
      "rewards/margins": 1.0784178972244263,
      "rewards/rejected": -0.8023491501808167,
      "step": 34,
      "train_speed(iter/s)": 0.005611
    },
    {
      "epoch": 0.06626826814981363,
      "grad_norm": 4.037520408630371,
      "learning_rate": 8.75e-05,
      "logits/chosen": -0.7001099586486816,
      "logits/rejected": -0.7051636576652527,
      "logps/chosen": -6.665594577789307,
      "logps/rejected": -30.973716735839844,
      "loss": 0.848934531211853,
      "memory(GiB)": 45.96,
      "nll_loss": 0.38612014055252075,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.15037909150123596,
      "rewards/margins": 1.0571930408477783,
      "rewards/rejected": -0.9068138599395752,
      "step": 35,
      "train_speed(iter/s)": 0.005618
    },
    {
      "epoch": 0.06816164723980829,
      "grad_norm": 3.6542232036590576,
      "learning_rate": 9e-05,
      "logits/chosen": -0.7070563435554504,
      "logits/rejected": -0.7053466439247131,
      "logps/chosen": -5.064585208892822,
      "logps/rejected": -19.19178581237793,
      "loss": 0.7724434733390808,
      "memory(GiB)": 45.96,
      "nll_loss": 0.26881077885627747,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.2176203727722168,
      "rewards/margins": 0.7342812418937683,
      "rewards/rejected": -0.5166608095169067,
      "step": 36,
      "train_speed(iter/s)": 0.005617
    },
    {
      "epoch": 0.07005502632980297,
      "grad_norm": 3.4213714599609375,
      "learning_rate": 9.250000000000001e-05,
      "logits/chosen": -0.7090893387794495,
      "logits/rejected": -0.7106159329414368,
      "logps/chosen": -10.25515365600586,
      "logps/rejected": -24.033281326293945,
      "loss": 0.9920384883880615,
      "memory(GiB)": 45.96,
      "nll_loss": 0.46471139788627625,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.0965394526720047,
      "rewards/margins": 0.8922154307365417,
      "rewards/rejected": -0.7956759929656982,
      "step": 37,
      "train_speed(iter/s)": 0.005619
    },
    {
      "epoch": 0.07194840541979765,
      "grad_norm": 5.325904846191406,
      "learning_rate": 9.5e-05,
      "logits/chosen": -0.657074511051178,
      "logits/rejected": -0.6611977815628052,
      "logps/chosen": -11.612046241760254,
      "logps/rejected": -27.249744415283203,
      "loss": 0.8334037065505981,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3489510715007782,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.12560953199863434,
      "rewards/margins": 0.9447187781333923,
      "rewards/rejected": -0.819109320640564,
      "step": 38,
      "train_speed(iter/s)": 0.005622
    },
    {
      "epoch": 0.07384178450979231,
      "grad_norm": 2.9407873153686523,
      "learning_rate": 9.75e-05,
      "logits/chosen": -0.7148993611335754,
      "logits/rejected": -0.7166731357574463,
      "logps/chosen": -7.349883079528809,
      "logps/rejected": -25.866724014282227,
      "loss": 0.7971550822257996,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3317265808582306,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.1786963939666748,
      "rewards/margins": 0.9361187815666199,
      "rewards/rejected": -0.7574224472045898,
      "step": 39,
      "train_speed(iter/s)": 0.005621
    },
    {
      "epoch": 0.07573516359978699,
      "grad_norm": 7.271725654602051,
      "learning_rate": 0.0001,
      "logits/chosen": -0.6494594216346741,
      "logits/rejected": -0.6519922018051147,
      "logps/chosen": -10.921842575073242,
      "logps/rejected": -26.213640213012695,
      "loss": 1.3029272556304932,
      "memory(GiB)": 45.96,
      "nll_loss": 0.7071102261543274,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.04726380109786987,
      "rewards/margins": 0.7260035276412964,
      "rewards/rejected": -0.6787396669387817,
      "step": 40,
      "train_speed(iter/s)": 0.005622
    },
    {
      "epoch": 0.07762854268978167,
      "grad_norm": 2.3149876594543457,
      "learning_rate": 0.0001025,
      "logits/chosen": -0.6998907327651978,
      "logits/rejected": -0.7039870023727417,
      "logps/chosen": -4.173505783081055,
      "logps/rejected": -23.617250442504883,
      "loss": 0.5567827224731445,
      "memory(GiB)": 45.96,
      "nll_loss": 0.22731299698352814,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.3785739839076996,
      "rewards/margins": 1.2282123565673828,
      "rewards/rejected": -0.8496384620666504,
      "step": 41,
      "train_speed(iter/s)": 0.005623
    },
    {
      "epoch": 0.07952192177977635,
      "grad_norm": 2.81628155708313,
      "learning_rate": 0.000105,
      "logits/chosen": -0.7065268754959106,
      "logits/rejected": -0.7109476923942566,
      "logps/chosen": -7.945868492126465,
      "logps/rejected": -28.209381103515625,
      "loss": 0.9143926501274109,
      "memory(GiB)": 45.96,
      "nll_loss": 0.45929795503616333,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.14874038100242615,
      "rewards/margins": 0.9704731702804565,
      "rewards/rejected": -0.8217328786849976,
      "step": 42,
      "train_speed(iter/s)": 0.005624
    },
    {
      "epoch": 0.08141530086977102,
      "grad_norm": 5.763336658477783,
      "learning_rate": 0.0001075,
      "logits/chosen": -0.6870285868644714,
      "logits/rejected": -0.6968757510185242,
      "logps/chosen": -5.37760066986084,
      "logps/rejected": -30.209644317626953,
      "loss": 1.0033479928970337,
      "memory(GiB)": 45.96,
      "nll_loss": 0.5952383279800415,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.25675737857818604,
      "rewards/margins": 1.0465596914291382,
      "rewards/rejected": -0.7898023128509521,
      "step": 43,
      "train_speed(iter/s)": 0.005627
    },
    {
      "epoch": 0.0833086799597657,
      "grad_norm": 5.945868015289307,
      "learning_rate": 0.00011000000000000002,
      "logits/chosen": -0.6680281758308411,
      "logits/rejected": -0.6685014963150024,
      "logps/chosen": -11.777937889099121,
      "logps/rejected": -14.195478439331055,
      "loss": 1.2500255107879639,
      "memory(GiB)": 45.96,
      "nll_loss": 0.6744679808616638,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.2654823362827301,
      "rewards/margins": 0.44828659296035767,
      "rewards/rejected": -0.18280424177646637,
      "step": 44,
      "train_speed(iter/s)": 0.005626
    },
    {
      "epoch": 0.08520205904976037,
      "grad_norm": 3.6887738704681396,
      "learning_rate": 0.00011250000000000001,
      "logits/chosen": -0.6420993804931641,
      "logits/rejected": -0.649295449256897,
      "logps/chosen": -5.845967769622803,
      "logps/rejected": -29.958538055419922,
      "loss": 0.8367453217506409,
      "memory(GiB)": 45.96,
      "nll_loss": 0.40336742997169495,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.25286757946014404,
      "rewards/margins": 0.9195659160614014,
      "rewards/rejected": -0.6666983962059021,
      "step": 45,
      "train_speed(iter/s)": 0.005627
    },
    {
      "epoch": 0.08709543813975504,
      "grad_norm": 2.1550676822662354,
      "learning_rate": 0.00011499999999999999,
      "logits/chosen": -0.6583084464073181,
      "logits/rejected": -0.6640565395355225,
      "logps/chosen": -2.7918519973754883,
      "logps/rejected": -30.053329467773438,
      "loss": 0.6384420394897461,
      "memory(GiB)": 45.96,
      "nll_loss": 0.16433243453502655,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.33078277111053467,
      "rewards/margins": 0.8035537004470825,
      "rewards/rejected": -0.4727708697319031,
      "step": 46,
      "train_speed(iter/s)": 0.005628
    },
    {
      "epoch": 0.08898881722974972,
      "grad_norm": 1.9267369508743286,
      "learning_rate": 0.00011750000000000001,
      "logits/chosen": -0.6443086266517639,
      "logits/rejected": -0.6484851837158203,
      "logps/chosen": -6.4907331466674805,
      "logps/rejected": -26.10548973083496,
      "loss": 0.8166890740394592,
      "memory(GiB)": 45.96,
      "nll_loss": 0.2826446294784546,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.33410829305648804,
      "rewards/margins": 0.7130259275436401,
      "rewards/rejected": -0.3789176642894745,
      "step": 47,
      "train_speed(iter/s)": 0.005627
    },
    {
      "epoch": 0.0908821963197444,
      "grad_norm": 2.238929510116577,
      "learning_rate": 0.00012,
      "logits/chosen": -0.6500992774963379,
      "logits/rejected": -0.6550747156143188,
      "logps/chosen": -6.974908351898193,
      "logps/rejected": -25.759687423706055,
      "loss": 0.8363897800445557,
      "memory(GiB)": 45.96,
      "nll_loss": 0.26740241050720215,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.2779407501220703,
      "rewards/margins": 0.71395343542099,
      "rewards/rejected": -0.43601274490356445,
      "step": 48,
      "train_speed(iter/s)": 0.005623
    },
    {
      "epoch": 0.09277557540973908,
      "grad_norm": 2.5497782230377197,
      "learning_rate": 0.00012250000000000002,
      "logits/chosen": -0.676102876663208,
      "logits/rejected": -0.676883339881897,
      "logps/chosen": -6.410519599914551,
      "logps/rejected": -17.417396545410156,
      "loss": 0.9155470728874207,
      "memory(GiB)": 45.96,
      "nll_loss": 0.3170667886734009,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": 0.24874374270439148,
      "rewards/margins": 0.6556647419929504,
      "rewards/rejected": -0.40692102909088135,
      "step": 49,
      "train_speed(iter/s)": 0.005623
    },
    {
      "epoch": 0.09466895449973374,
      "grad_norm": 2.275879144668579,
      "learning_rate": 0.000125,
      "logits/chosen": -0.6682412028312683,
      "logits/rejected": -0.6694232225418091,
      "logps/chosen": -7.84281587600708,
      "logps/rejected": -18.11672019958496,
      "loss": 0.8602735996246338,
      "memory(GiB)": 45.96,
      "nll_loss": 0.342671662569046,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.16426895558834076,
      "rewards/margins": 0.6373977065086365,
      "rewards/rejected": -0.47312870621681213,
      "step": 50,
      "train_speed(iter/s)": 0.005623
    }
  ],
  "logging_steps": 1,
  "max_steps": 1584,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 3,
  "save_steps": 50,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 3.5033118748862054e+17,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}