PEFT
Safetensors
File size: 32,667 Bytes
a97dafa
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.2882882882882883,
  "eval_steps": 300,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.005765765765765766,
      "grad_norm": 2.1474921703338623,
      "learning_rate": 7.692307692307694e-06,
      "logits/chosen": -0.4285973310470581,
      "logits/rejected": -0.721319854259491,
      "logps/chosen": -2.468954086303711,
      "logps/rejected": -59.87730407714844,
      "loss": 0.22946561872959137,
      "memory(GiB)": 30.65,
      "nll_loss": 0.13756254315376282,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.23724405467510223,
      "rewards/margins": 3.9806408882141113,
      "rewards/rejected": -3.743396759033203,
      "step": 1,
      "train_speed(iter/s)": 0.01022
    },
    {
      "epoch": 0.011531531531531532,
      "grad_norm": 2.328110456466675,
      "learning_rate": 1.5384615384615387e-05,
      "logits/chosen": -0.3982561528682709,
      "logits/rejected": -0.7214521169662476,
      "logps/chosen": -3.335645914077759,
      "logps/rejected": -60.79209899902344,
      "loss": 0.3770241439342499,
      "memory(GiB)": 30.65,
      "nll_loss": 0.23075783252716064,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.10687967389822006,
      "rewards/margins": 3.9392333030700684,
      "rewards/rejected": -3.832353353500366,
      "step": 2,
      "train_speed(iter/s)": 0.010488
    },
    {
      "epoch": 0.017297297297297298,
      "grad_norm": 14.568985939025879,
      "learning_rate": 2.307692307692308e-05,
      "logits/chosen": -0.43175598978996277,
      "logits/rejected": -0.6921666264533997,
      "logps/chosen": -5.190546035766602,
      "logps/rejected": -51.33646011352539,
      "loss": 0.9886025786399841,
      "memory(GiB)": 34.1,
      "nll_loss": 0.6371194124221802,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": -0.034887176007032394,
      "rewards/margins": 3.2021734714508057,
      "rewards/rejected": -3.237060785293579,
      "step": 3,
      "train_speed(iter/s)": 0.010581
    },
    {
      "epoch": 0.023063063063063063,
      "grad_norm": 13.817249298095703,
      "learning_rate": 3.0769230769230774e-05,
      "logits/chosen": -0.4616771340370178,
      "logits/rejected": -0.6264235973358154,
      "logps/chosen": -3.2552552223205566,
      "logps/rejected": -51.25586700439453,
      "loss": 0.5021163821220398,
      "memory(GiB)": 37.58,
      "nll_loss": 0.26375898718833923,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.06816040724515915,
      "rewards/margins": 3.5297036170959473,
      "rewards/rejected": -3.461543083190918,
      "step": 4,
      "train_speed(iter/s)": 0.010625
    },
    {
      "epoch": 0.02882882882882883,
      "grad_norm": 2.363553524017334,
      "learning_rate": 3.846153846153846e-05,
      "logits/chosen": -0.48805952072143555,
      "logits/rejected": -0.7040677070617676,
      "logps/chosen": -6.89398717880249,
      "logps/rejected": -59.37879943847656,
      "loss": 0.39657193422317505,
      "memory(GiB)": 37.58,
      "nll_loss": 0.2818652391433716,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.1999940723180771,
      "rewards/margins": 4.230030059814453,
      "rewards/rejected": -4.030035495758057,
      "step": 5,
      "train_speed(iter/s)": 0.010659
    },
    {
      "epoch": 0.034594594594594595,
      "grad_norm": 4.551424026489258,
      "learning_rate": 4.615384615384616e-05,
      "logits/chosen": -0.39471542835235596,
      "logits/rejected": -0.6508359909057617,
      "logps/chosen": -6.633285999298096,
      "logps/rejected": -58.268653869628906,
      "loss": 0.5636770129203796,
      "memory(GiB)": 41.24,
      "nll_loss": 0.41472452878952026,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.1396198272705078,
      "rewards/margins": 3.7723348140716553,
      "rewards/rejected": -3.6327152252197266,
      "step": 6,
      "train_speed(iter/s)": 0.010667
    },
    {
      "epoch": 0.04036036036036036,
      "grad_norm": 4.302145481109619,
      "learning_rate": 5.384615384615385e-05,
      "logits/chosen": -0.42404329776763916,
      "logits/rejected": -0.7084805369377136,
      "logps/chosen": -4.09792947769165,
      "logps/rejected": -69.69088745117188,
      "loss": 0.5202179551124573,
      "memory(GiB)": 41.24,
      "nll_loss": 0.3875095546245575,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": -0.018997177481651306,
      "rewards/margins": 5.0437703132629395,
      "rewards/rejected": -5.062767505645752,
      "step": 7,
      "train_speed(iter/s)": 0.010685
    },
    {
      "epoch": 0.04612612612612613,
      "grad_norm": 4.475785255432129,
      "learning_rate": 6.153846153846155e-05,
      "logits/chosen": -0.4411894977092743,
      "logits/rejected": -0.6594015955924988,
      "logps/chosen": -6.067828178405762,
      "logps/rejected": -52.161441802978516,
      "loss": 0.8079419136047363,
      "memory(GiB)": 41.24,
      "nll_loss": 0.5527109503746033,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.13843362033367157,
      "rewards/margins": 3.638244390487671,
      "rewards/rejected": -3.4998104572296143,
      "step": 8,
      "train_speed(iter/s)": 0.010699
    },
    {
      "epoch": 0.05189189189189189,
      "grad_norm": 7.412286281585693,
      "learning_rate": 6.923076923076924e-05,
      "logits/chosen": -0.4308490753173828,
      "logits/rejected": -0.6868806481361389,
      "logps/chosen": -4.5601372718811035,
      "logps/rejected": -75.88018798828125,
      "loss": 0.3704576790332794,
      "memory(GiB)": 41.24,
      "nll_loss": 0.23506566882133484,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.1938612163066864,
      "rewards/margins": 5.914104461669922,
      "rewards/rejected": -5.720243453979492,
      "step": 9,
      "train_speed(iter/s)": 0.010708
    },
    {
      "epoch": 0.05765765765765766,
      "grad_norm": 2.0841763019561768,
      "learning_rate": 7.692307692307693e-05,
      "logits/chosen": -0.4546598792076111,
      "logits/rejected": -0.7517622113227844,
      "logps/chosen": -1.471292495727539,
      "logps/rejected": -70.88200378417969,
      "loss": 0.2737431526184082,
      "memory(GiB)": 41.24,
      "nll_loss": 0.14067727327346802,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.13278257846832275,
      "rewards/margins": 5.628582000732422,
      "rewards/rejected": -5.495799541473389,
      "step": 10,
      "train_speed(iter/s)": 0.010721
    },
    {
      "epoch": 0.06342342342342343,
      "grad_norm": 5.912591457366943,
      "learning_rate": 8.461538461538461e-05,
      "logits/chosen": -0.4128813147544861,
      "logits/rejected": -0.5927000045776367,
      "logps/chosen": -7.319942474365234,
      "logps/rejected": -61.27806091308594,
      "loss": 0.5680095553398132,
      "memory(GiB)": 41.24,
      "nll_loss": 0.3753523826599121,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": 0.07616602629423141,
      "rewards/margins": 4.830938816070557,
      "rewards/rejected": -4.754772663116455,
      "step": 11,
      "train_speed(iter/s)": 0.010727
    },
    {
      "epoch": 0.06918918918918919,
      "grad_norm": 2.5374209880828857,
      "learning_rate": 9.230769230769232e-05,
      "logits/chosen": -0.349031925201416,
      "logits/rejected": -0.6373917460441589,
      "logps/chosen": -4.199922561645508,
      "logps/rejected": -72.83607482910156,
      "loss": 0.34027042984962463,
      "memory(GiB)": 41.24,
      "nll_loss": 0.22808796167373657,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.20608201622962952,
      "rewards/margins": 5.424815654754639,
      "rewards/rejected": -5.218733787536621,
      "step": 12,
      "train_speed(iter/s)": 0.010728
    },
    {
      "epoch": 0.07495495495495495,
      "grad_norm": 2.7130517959594727,
      "learning_rate": 0.0001,
      "logits/chosen": -0.3631379306316376,
      "logits/rejected": -0.6601940989494324,
      "logps/chosen": -3.3938565254211426,
      "logps/rejected": -65.2313232421875,
      "loss": 0.4514213800430298,
      "memory(GiB)": 41.24,
      "nll_loss": 0.30333614349365234,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.06806281208992004,
      "rewards/margins": 4.726724624633789,
      "rewards/rejected": -4.658661365509033,
      "step": 13,
      "train_speed(iter/s)": 0.010733
    },
    {
      "epoch": 0.08072072072072072,
      "grad_norm": 1.5474798679351807,
      "learning_rate": 0.0001076923076923077,
      "logits/chosen": -0.4096493124961853,
      "logits/rejected": -0.6515597105026245,
      "logps/chosen": -2.300206184387207,
      "logps/rejected": -57.26811218261719,
      "loss": 0.3060320019721985,
      "memory(GiB)": 41.24,
      "nll_loss": 0.1727571338415146,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.08898697793483734,
      "rewards/margins": 4.1406354904174805,
      "rewards/rejected": -4.0516486167907715,
      "step": 14,
      "train_speed(iter/s)": 0.010737
    },
    {
      "epoch": 0.08648648648648649,
      "grad_norm": 1.628075361251831,
      "learning_rate": 0.00011538461538461538,
      "logits/chosen": -0.4402551054954529,
      "logits/rejected": -0.6672070622444153,
      "logps/chosen": -2.9995224475860596,
      "logps/rejected": -53.87057113647461,
      "loss": 0.3575773239135742,
      "memory(GiB)": 41.24,
      "nll_loss": 0.2217392474412918,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.20550209283828735,
      "rewards/margins": 3.6874935626983643,
      "rewards/rejected": -3.4819912910461426,
      "step": 15,
      "train_speed(iter/s)": 0.010742
    },
    {
      "epoch": 0.09225225225225225,
      "grad_norm": 1.838375449180603,
      "learning_rate": 0.0001230769230769231,
      "logits/chosen": -0.3547935485839844,
      "logits/rejected": -0.6626885533332825,
      "logps/chosen": -4.558413982391357,
      "logps/rejected": -64.36922454833984,
      "loss": 0.45015937089920044,
      "memory(GiB)": 41.24,
      "nll_loss": 0.3128659129142761,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.14241908490657806,
      "rewards/margins": 4.83186149597168,
      "rewards/rejected": -4.689442157745361,
      "step": 16,
      "train_speed(iter/s)": 0.010745
    },
    {
      "epoch": 0.09801801801801802,
      "grad_norm": 3.119417667388916,
      "learning_rate": 0.00013076923076923077,
      "logits/chosen": -0.3334687352180481,
      "logits/rejected": -0.6293997168540955,
      "logps/chosen": -5.949204444885254,
      "logps/rejected": -74.25395965576172,
      "loss": 0.6850419044494629,
      "memory(GiB)": 41.24,
      "nll_loss": 0.5004001259803772,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.07516612857580185,
      "rewards/margins": 4.788809776306152,
      "rewards/rejected": -4.713644027709961,
      "step": 17,
      "train_speed(iter/s)": 0.010741
    },
    {
      "epoch": 0.10378378378378378,
      "grad_norm": 1.6356091499328613,
      "learning_rate": 0.00013846153846153847,
      "logits/chosen": -0.3526935875415802,
      "logits/rejected": -0.6357190608978271,
      "logps/chosen": -2.911073923110962,
      "logps/rejected": -66.46131896972656,
      "loss": 0.32070592045783997,
      "memory(GiB)": 41.24,
      "nll_loss": 0.18397927284240723,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.09694083034992218,
      "rewards/margins": 5.153117656707764,
      "rewards/rejected": -5.056177139282227,
      "step": 18,
      "train_speed(iter/s)": 0.010741
    },
    {
      "epoch": 0.10954954954954955,
      "grad_norm": 2.7403504848480225,
      "learning_rate": 0.00014615384615384615,
      "logits/chosen": -0.3763662278652191,
      "logits/rejected": -0.586420476436615,
      "logps/chosen": -4.417596340179443,
      "logps/rejected": -58.99639892578125,
      "loss": 0.4634058177471161,
      "memory(GiB)": 41.24,
      "nll_loss": 0.28715017437934875,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.1435782015323639,
      "rewards/margins": 4.609218120574951,
      "rewards/rejected": -4.465640068054199,
      "step": 19,
      "train_speed(iter/s)": 0.010743
    },
    {
      "epoch": 0.11531531531531532,
      "grad_norm": 1.982851266860962,
      "learning_rate": 0.00015384615384615385,
      "logits/chosen": -0.3701193332672119,
      "logits/rejected": -0.6088087558746338,
      "logps/chosen": -4.619842529296875,
      "logps/rejected": -68.1020278930664,
      "loss": 0.4344192445278168,
      "memory(GiB)": 41.24,
      "nll_loss": 0.26591166853904724,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.10610304027795792,
      "rewards/margins": 5.044137954711914,
      "rewards/rejected": -4.938034534454346,
      "step": 20,
      "train_speed(iter/s)": 0.010745
    },
    {
      "epoch": 0.12108108108108108,
      "grad_norm": 3.175961494445801,
      "learning_rate": 0.00016153846153846155,
      "logits/chosen": -0.40009674429893494,
      "logits/rejected": -0.642030656337738,
      "logps/chosen": -3.357761859893799,
      "logps/rejected": -65.21231842041016,
      "loss": 0.40142354369163513,
      "memory(GiB)": 41.24,
      "nll_loss": 0.2889588177204132,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.1323939859867096,
      "rewards/margins": 5.234187602996826,
      "rewards/rejected": -5.1017937660217285,
      "step": 21,
      "train_speed(iter/s)": 0.010748
    },
    {
      "epoch": 0.12684684684684686,
      "grad_norm": 1.9400721788406372,
      "learning_rate": 0.00016923076923076923,
      "logits/chosen": -0.3025435209274292,
      "logits/rejected": -0.6950021386146545,
      "logps/chosen": -2.492130994796753,
      "logps/rejected": -107.03312683105469,
      "loss": 0.2920421361923218,
      "memory(GiB)": 41.24,
      "nll_loss": 0.19772115349769592,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.19073158502578735,
      "rewards/margins": 8.599780082702637,
      "rewards/rejected": -8.409048080444336,
      "step": 22,
      "train_speed(iter/s)": 0.010746
    },
    {
      "epoch": 0.13261261261261262,
      "grad_norm": 1.3099267482757568,
      "learning_rate": 0.00017692307692307693,
      "logits/chosen": -0.36498135328292847,
      "logits/rejected": -0.6359634399414062,
      "logps/chosen": -2.421377658843994,
      "logps/rejected": -74.05368041992188,
      "loss": 0.20869436860084534,
      "memory(GiB)": 41.24,
      "nll_loss": 0.11023169010877609,
      "rewards/accuracies": 1.0,
      "rewards/chosen": 0.18500684201717377,
      "rewards/margins": 5.958514213562012,
      "rewards/rejected": -5.773507118225098,
      "step": 23,
      "train_speed(iter/s)": 0.010747
    },
    {
      "epoch": 0.13837837837837838,
      "grad_norm": 1.9334064722061157,
      "learning_rate": 0.00018461538461538463,
      "logits/chosen": -0.45037421584129333,
      "logits/rejected": -0.7719848155975342,
      "logps/chosen": -2.6665430068969727,
      "logps/rejected": -94.5350570678711,
      "loss": 0.3057625889778137,
      "memory(GiB)": 41.24,
      "nll_loss": 0.2374470978975296,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.09573014080524445,
      "rewards/margins": 8.040020942687988,
      "rewards/rejected": -7.944291114807129,
      "step": 24,
      "train_speed(iter/s)": 0.010749
    },
    {
      "epoch": 0.14414414414414414,
      "grad_norm": 7.789314270019531,
      "learning_rate": 0.00019230769230769233,
      "logits/chosen": -0.3473276197910309,
      "logits/rejected": -0.6793957352638245,
      "logps/chosen": -4.235269069671631,
      "logps/rejected": -109.01844024658203,
      "loss": 0.42337244749069214,
      "memory(GiB)": 41.24,
      "nll_loss": 0.21255403757095337,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.009569963440299034,
      "rewards/margins": 8.769816398620605,
      "rewards/rejected": -8.760246276855469,
      "step": 25,
      "train_speed(iter/s)": 0.010747
    },
    {
      "epoch": 0.1499099099099099,
      "grad_norm": 1.970948338508606,
      "learning_rate": 0.0002,
      "logits/chosen": -0.40258127450942993,
      "logits/rejected": -0.7479668259620667,
      "logps/chosen": -2.0013341903686523,
      "logps/rejected": -85.51154327392578,
      "loss": 0.4197818636894226,
      "memory(GiB)": 41.24,
      "nll_loss": 0.2574591636657715,
      "rewards/accuracies": 1.0,
      "rewards/chosen": 0.16396881639957428,
      "rewards/margins": 7.033238410949707,
      "rewards/rejected": -6.869269847869873,
      "step": 26,
      "train_speed(iter/s)": 0.010746
    },
    {
      "epoch": 0.15567567567567567,
      "grad_norm": 11.3534574508667,
      "learning_rate": 0.00019999796963348897,
      "logits/chosen": -0.5246711373329163,
      "logits/rejected": -0.7294141054153442,
      "logps/chosen": -11.85606575012207,
      "logps/rejected": -76.03211975097656,
      "loss": 0.8875234127044678,
      "memory(GiB)": 41.24,
      "nll_loss": 0.575400710105896,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": -0.2269383817911148,
      "rewards/margins": 5.498793125152588,
      "rewards/rejected": -5.725731372833252,
      "step": 27,
      "train_speed(iter/s)": 0.010747
    },
    {
      "epoch": 0.16144144144144143,
      "grad_norm": 2.0314371585845947,
      "learning_rate": 0.00019999187861640362,
      "logits/chosen": -0.5284671187400818,
      "logits/rejected": -0.7846834063529968,
      "logps/chosen": -4.434022426605225,
      "logps/rejected": -87.89623260498047,
      "loss": 0.3868662416934967,
      "memory(GiB)": 41.24,
      "nll_loss": 0.30320096015930176,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.07812386751174927,
      "rewards/margins": 7.374299049377441,
      "rewards/rejected": -7.296175479888916,
      "step": 28,
      "train_speed(iter/s)": 0.010748
    },
    {
      "epoch": 0.16720720720720722,
      "grad_norm": 6.089433193206787,
      "learning_rate": 0.0001999817271960839,
      "logits/chosen": -0.4792092442512512,
      "logits/rejected": -0.7371792793273926,
      "logps/chosen": -3.6791412830352783,
      "logps/rejected": -80.48262023925781,
      "loss": 0.34335166215896606,
      "memory(GiB)": 41.24,
      "nll_loss": 0.22308313846588135,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": -0.049518827348947525,
      "rewards/margins": 6.395692825317383,
      "rewards/rejected": -6.445211410522461,
      "step": 29,
      "train_speed(iter/s)": 0.010751
    },
    {
      "epoch": 0.17297297297297298,
      "grad_norm": 1.8896535634994507,
      "learning_rate": 0.00019996751578475186,
      "logits/chosen": -0.44468259811401367,
      "logits/rejected": -0.7023504972457886,
      "logps/chosen": -3.048004388809204,
      "logps/rejected": -80.6348648071289,
      "loss": 0.30949145555496216,
      "memory(GiB)": 41.24,
      "nll_loss": 0.1800393909215927,
      "rewards/accuracies": 1.0,
      "rewards/chosen": 0.15738406777381897,
      "rewards/margins": 5.8682780265808105,
      "rewards/rejected": -5.710893630981445,
      "step": 30,
      "train_speed(iter/s)": 0.010749
    },
    {
      "epoch": 0.17873873873873874,
      "grad_norm": 2.7516067028045654,
      "learning_rate": 0.00019994924495949504,
      "logits/chosen": -0.4754641652107239,
      "logits/rejected": -0.7408227920532227,
      "logps/chosen": -5.943354606628418,
      "logps/rejected": -79.13115692138672,
      "loss": 0.6435320973396301,
      "memory(GiB)": 41.24,
      "nll_loss": 0.4586246609687805,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.0629303902387619,
      "rewards/margins": 6.110820293426514,
      "rewards/rejected": -6.0478901863098145,
      "step": 31,
      "train_speed(iter/s)": 0.01075
    },
    {
      "epoch": 0.1845045045045045,
      "grad_norm": 5.854465007781982,
      "learning_rate": 0.00019992691546224278,
      "logits/chosen": -0.45127877593040466,
      "logits/rejected": -0.7568551898002625,
      "logps/chosen": -2.736678123474121,
      "logps/rejected": -66.9885025024414,
      "loss": 0.3652667701244354,
      "memory(GiB)": 41.24,
      "nll_loss": 0.16899552941322327,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.050895966589450836,
      "rewards/margins": 4.933393478393555,
      "rewards/rejected": -4.882497310638428,
      "step": 32,
      "train_speed(iter/s)": 0.01075
    },
    {
      "epoch": 0.19027027027027027,
      "grad_norm": 1.3124663829803467,
      "learning_rate": 0.00019990052819973642,
      "logits/chosen": -0.3465266227722168,
      "logits/rejected": -0.6685288548469543,
      "logps/chosen": -3.301164388656616,
      "logps/rejected": -85.9378662109375,
      "loss": 0.3046538233757019,
      "memory(GiB)": 41.24,
      "nll_loss": 0.1670866757631302,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.17874348163604736,
      "rewards/margins": 6.709518909454346,
      "rewards/rejected": -6.530775547027588,
      "step": 33,
      "train_speed(iter/s)": 0.010748
    },
    {
      "epoch": 0.19603603603603603,
      "grad_norm": 2.341381549835205,
      "learning_rate": 0.00019987008424349225,
      "logits/chosen": -0.38037875294685364,
      "logits/rejected": -0.699614405632019,
      "logps/chosen": -1.5970546007156372,
      "logps/rejected": -74.28025817871094,
      "loss": 0.20820346474647522,
      "memory(GiB)": 41.24,
      "nll_loss": 0.10679290443658829,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.11616384983062744,
      "rewards/margins": 5.825808048248291,
      "rewards/rejected": -5.709644794464111,
      "step": 34,
      "train_speed(iter/s)": 0.010749
    },
    {
      "epoch": 0.2018018018018018,
      "grad_norm": 5.144662380218506,
      "learning_rate": 0.00019983558482975799,
      "logits/chosen": -0.46614986658096313,
      "logits/rejected": -0.6599275469779968,
      "logps/chosen": -5.982501983642578,
      "logps/rejected": -67.7139892578125,
      "loss": 0.5879941582679749,
      "memory(GiB)": 41.24,
      "nll_loss": 0.4303022027015686,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.16055577993392944,
      "rewards/margins": 5.052016258239746,
      "rewards/rejected": -4.89146089553833,
      "step": 35,
      "train_speed(iter/s)": 0.010749
    },
    {
      "epoch": 0.20756756756756756,
      "grad_norm": 1.990370273590088,
      "learning_rate": 0.00019979703135946278,
      "logits/chosen": -0.4655105471611023,
      "logits/rejected": -0.6668959856033325,
      "logps/chosen": -4.062808036804199,
      "logps/rejected": -72.87210845947266,
      "loss": 0.4453062415122986,
      "memory(GiB)": 41.24,
      "nll_loss": 0.25426411628723145,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.09591292589902878,
      "rewards/margins": 5.528655052185059,
      "rewards/rejected": -5.432741641998291,
      "step": 36,
      "train_speed(iter/s)": 0.010749
    },
    {
      "epoch": 0.21333333333333335,
      "grad_norm": 2.0748369693756104,
      "learning_rate": 0.00019975442539816012,
      "logits/chosen": -0.4139191210269928,
      "logits/rejected": -0.7536109685897827,
      "logps/chosen": -5.956673622131348,
      "logps/rejected": -66.99488830566406,
      "loss": 0.5514004826545715,
      "memory(GiB)": 41.24,
      "nll_loss": 0.3969358503818512,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.33245787024497986,
      "rewards/margins": 5.0754570960998535,
      "rewards/rejected": -4.742999076843262,
      "step": 37,
      "train_speed(iter/s)": 0.01075
    },
    {
      "epoch": 0.2190990990990991,
      "grad_norm": 1.6668081283569336,
      "learning_rate": 0.0001997077686759643,
      "logits/chosen": -0.42306363582611084,
      "logits/rejected": -0.6915761232376099,
      "logps/chosen": -3.814265727996826,
      "logps/rejected": -82.30941772460938,
      "loss": 0.3710038363933563,
      "memory(GiB)": 41.24,
      "nll_loss": 0.22380009293556213,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.06087161600589752,
      "rewards/margins": 6.076653957366943,
      "rewards/rejected": -6.015782356262207,
      "step": 38,
      "train_speed(iter/s)": 0.01075
    },
    {
      "epoch": 0.22486486486486487,
      "grad_norm": 13.827637672424316,
      "learning_rate": 0.00019965706308748028,
      "logits/chosen": -0.49769100546836853,
      "logits/rejected": -0.7370949983596802,
      "logps/chosen": -3.956310272216797,
      "logps/rejected": -79.41323852539062,
      "loss": 0.6633445620536804,
      "memory(GiB)": 41.24,
      "nll_loss": 0.3870386779308319,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": -0.13494591414928436,
      "rewards/margins": 6.147372722625732,
      "rewards/rejected": -6.282319068908691,
      "step": 39,
      "train_speed(iter/s)": 0.010751
    },
    {
      "epoch": 0.23063063063063063,
      "grad_norm": 2.19854474067688,
      "learning_rate": 0.0001996023106917267,
      "logits/chosen": -0.44343504309654236,
      "logits/rejected": -0.6730125546455383,
      "logps/chosen": -2.9238576889038086,
      "logps/rejected": -77.40494537353516,
      "loss": 0.3453696668148041,
      "memory(GiB)": 41.24,
      "nll_loss": 0.19069285690784454,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.14595907926559448,
      "rewards/margins": 6.002254486083984,
      "rewards/rejected": -5.856295108795166,
      "step": 40,
      "train_speed(iter/s)": 0.010752
    },
    {
      "epoch": 0.2363963963963964,
      "grad_norm": 6.0794596672058105,
      "learning_rate": 0.00019954351371205203,
      "logits/chosen": -0.47579658031463623,
      "logits/rejected": -0.6826990842819214,
      "logps/chosen": -5.335310935974121,
      "logps/rejected": -75.78384399414062,
      "loss": 0.575509250164032,
      "memory(GiB)": 41.24,
      "nll_loss": 0.4477939307689667,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.2103371024131775,
      "rewards/margins": 6.012211322784424,
      "rewards/rejected": -5.801875114440918,
      "step": 41,
      "train_speed(iter/s)": 0.010754
    },
    {
      "epoch": 0.24216216216216216,
      "grad_norm": 1.4152264595031738,
      "learning_rate": 0.00019948067453604473,
      "logits/chosen": -0.49620914459228516,
      "logits/rejected": -0.7446714043617249,
      "logps/chosen": -3.284031867980957,
      "logps/rejected": -77.9183349609375,
      "loss": 0.29828324913978577,
      "memory(GiB)": 41.24,
      "nll_loss": 0.21160344779491425,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.18678154051303864,
      "rewards/margins": 6.247434616088867,
      "rewards/rejected": -6.060652732849121,
      "step": 42,
      "train_speed(iter/s)": 0.010755
    },
    {
      "epoch": 0.24792792792792792,
      "grad_norm": 2.9591963291168213,
      "learning_rate": 0.00019941379571543596,
      "logits/chosen": -0.4777877628803253,
      "logits/rejected": -0.6974171996116638,
      "logps/chosen": -2.9466118812561035,
      "logps/rejected": -66.2719497680664,
      "loss": 0.35521066188812256,
      "memory(GiB)": 41.24,
      "nll_loss": 0.22793087363243103,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.27246373891830444,
      "rewards/margins": 5.403186798095703,
      "rewards/rejected": -5.130722999572754,
      "step": 43,
      "train_speed(iter/s)": 0.010756
    },
    {
      "epoch": 0.2536936936936937,
      "grad_norm": 4.199843883514404,
      "learning_rate": 0.00019934287996599607,
      "logits/chosen": -0.4372207522392273,
      "logits/rejected": -0.700534462928772,
      "logps/chosen": -3.31451416015625,
      "logps/rejected": -70.0909194946289,
      "loss": 0.3793654143810272,
      "memory(GiB)": 41.24,
      "nll_loss": 0.20433279871940613,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.059201404452323914,
      "rewards/margins": 4.912087917327881,
      "rewards/rejected": -4.852885723114014,
      "step": 44,
      "train_speed(iter/s)": 0.010756
    },
    {
      "epoch": 0.2594594594594595,
      "grad_norm": 0.7397028803825378,
      "learning_rate": 0.00019926793016742435,
      "logits/chosen": -0.42062634229660034,
      "logits/rejected": -0.7593384981155396,
      "logps/chosen": -1.404799222946167,
      "logps/rejected": -102.4892349243164,
      "loss": 0.1313902586698532,
      "memory(GiB)": 41.24,
      "nll_loss": 0.09521690011024475,
      "rewards/accuracies": 1.0,
      "rewards/chosen": 0.12229674309492111,
      "rewards/margins": 8.041703224182129,
      "rewards/rejected": -7.919405937194824,
      "step": 45,
      "train_speed(iter/s)": 0.010754
    },
    {
      "epoch": 0.26522522522522524,
      "grad_norm": 5.14201545715332,
      "learning_rate": 0.00019918894936323195,
      "logits/chosen": -0.3798273205757141,
      "logits/rejected": -0.5865642428398132,
      "logps/chosen": -6.911247730255127,
      "logps/rejected": -72.06941223144531,
      "loss": 0.49299517273902893,
      "memory(GiB)": 41.24,
      "nll_loss": 0.27924880385398865,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.1307646483182907,
      "rewards/margins": 5.647462368011475,
      "rewards/rejected": -5.516696929931641,
      "step": 46,
      "train_speed(iter/s)": 0.010753
    },
    {
      "epoch": 0.270990990990991,
      "grad_norm": 1.6439752578735352,
      "learning_rate": 0.00019910594076061853,
      "logits/chosen": -0.4431299567222595,
      "logits/rejected": -0.7268660664558411,
      "logps/chosen": -2.0275888442993164,
      "logps/rejected": -81.84529876708984,
      "loss": 0.23740296065807343,
      "memory(GiB)": 41.24,
      "nll_loss": 0.14832313358783722,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.06923090666532516,
      "rewards/margins": 6.1783928871154785,
      "rewards/rejected": -6.109161376953125,
      "step": 47,
      "train_speed(iter/s)": 0.010753
    },
    {
      "epoch": 0.27675675675675676,
      "grad_norm": 6.499570846557617,
      "learning_rate": 0.0001990189077303418,
      "logits/chosen": -0.45142635703086853,
      "logits/rejected": -0.7249264121055603,
      "logps/chosen": -5.794652938842773,
      "logps/rejected": -78.53363800048828,
      "loss": 0.46158841252326965,
      "memory(GiB)": 41.24,
      "nll_loss": 0.3398270010948181,
      "rewards/accuracies": 0.96875,
      "rewards/chosen": 0.24555836617946625,
      "rewards/margins": 6.308343887329102,
      "rewards/rejected": -6.062786102294922,
      "step": 48,
      "train_speed(iter/s)": 0.010753
    },
    {
      "epoch": 0.2825225225225225,
      "grad_norm": 5.58511209487915,
      "learning_rate": 0.00019892785380658078,
      "logits/chosen": -0.4099079370498657,
      "logits/rejected": -0.6898340582847595,
      "logps/chosen": -7.449429035186768,
      "logps/rejected": -92.18098449707031,
      "loss": 0.5815075039863586,
      "memory(GiB)": 41.24,
      "nll_loss": 0.41358357667922974,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": -0.053265977650880814,
      "rewards/margins": 7.150655269622803,
      "rewards/rejected": -7.203920841217041,
      "step": 49,
      "train_speed(iter/s)": 0.010752
    },
    {
      "epoch": 0.2882882882882883,
      "grad_norm": 1.5411535501480103,
      "learning_rate": 0.00019883278268679216,
      "logits/chosen": -0.4670988917350769,
      "logits/rejected": -0.6586328148841858,
      "logps/chosen": -6.984646320343018,
      "logps/rejected": -89.9208755493164,
      "loss": 0.45735102891921997,
      "memory(GiB)": 41.24,
      "nll_loss": 0.28862154483795166,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": 0.1682412177324295,
      "rewards/margins": 7.457679748535156,
      "rewards/rejected": -7.289438247680664,
      "step": 50,
      "train_speed(iter/s)": 0.01075
    }
  ],
  "logging_steps": 1,
  "max_steps": 519,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 3,
  "save_steps": 50,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 2.7372458004709376e+16,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}