PEFT
Safetensors
File size: 32,703 Bytes
b39a6ee
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.14292094685127288,
  "eval_steps": 300,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.002858418937025458,
      "grad_norm": 10.349462509155273,
      "learning_rate": 3.7735849056603773e-06,
      "logits/chosen": -0.6422490477561951,
      "logits/rejected": -0.6447486877441406,
      "logps/chosen": -6.999429225921631,
      "logps/rejected": -13.433603286743164,
      "loss": 1.3778549432754517,
      "memory(GiB)": 46.73,
      "nll_loss": 0.6847077012062073,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 1,
      "train_speed(iter/s)": 0.005273
    },
    {
      "epoch": 0.005716837874050916,
      "grad_norm": 11.263213157653809,
      "learning_rate": 7.547169811320755e-06,
      "logits/chosen": -0.6429960131645203,
      "logits/rejected": -0.6454926133155823,
      "logps/chosen": -9.604641914367676,
      "logps/rejected": -13.53369140625,
      "loss": 1.4975696802139282,
      "memory(GiB)": 46.73,
      "nll_loss": 0.8044224381446838,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 2,
      "train_speed(iter/s)": 0.005366
    },
    {
      "epoch": 0.008575256811076373,
      "grad_norm": 9.09404182434082,
      "learning_rate": 1.1320754716981132e-05,
      "logits/chosen": -0.6486532092094421,
      "logits/rejected": -0.6493248343467712,
      "logps/chosen": -7.69912576675415,
      "logps/rejected": -17.816326141357422,
      "loss": 1.2593896389007568,
      "memory(GiB)": 46.73,
      "nll_loss": 0.5679630637168884,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.0031128099653869867,
      "rewards/margins": 0.0035441224463284016,
      "rewards/rejected": -0.00043131227721460164,
      "step": 3,
      "train_speed(iter/s)": 0.005419
    },
    {
      "epoch": 0.011433675748101831,
      "grad_norm": 13.314420700073242,
      "learning_rate": 1.509433962264151e-05,
      "logits/chosen": -0.6668453812599182,
      "logits/rejected": -0.6718658804893494,
      "logps/chosen": -6.061755180358887,
      "logps/rejected": -13.643918991088867,
      "loss": 1.4406771659851074,
      "memory(GiB)": 46.73,
      "nll_loss": 0.7477570176124573,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": 0.008774133399128914,
      "rewards/margins": 0.0006008772179484367,
      "rewards/rejected": 0.008173256181180477,
      "step": 4,
      "train_speed(iter/s)": 0.005446
    },
    {
      "epoch": 0.014292094685127288,
      "grad_norm": 12.340804100036621,
      "learning_rate": 1.8867924528301888e-05,
      "logits/chosen": -0.6321276426315308,
      "logits/rejected": -0.6321861743927002,
      "logps/chosen": -11.234216690063477,
      "logps/rejected": -11.82645034790039,
      "loss": 1.3690662384033203,
      "memory(GiB)": 46.73,
      "nll_loss": 0.6870464086532593,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.032103873789310455,
      "rewards/margins": 0.022960105910897255,
      "rewards/rejected": 0.0091437678784132,
      "step": 5,
      "train_speed(iter/s)": 0.005444
    },
    {
      "epoch": 0.017150513622152745,
      "grad_norm": 13.995262145996094,
      "learning_rate": 2.2641509433962265e-05,
      "logits/chosen": -0.6530164480209351,
      "logits/rejected": -0.6550691723823547,
      "logps/chosen": -8.742744445800781,
      "logps/rejected": -12.622247695922852,
      "loss": 1.3672001361846924,
      "memory(GiB)": 46.73,
      "nll_loss": 0.702350378036499,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.0800265222787857,
      "rewards/margins": 0.06047351285815239,
      "rewards/rejected": 0.019553007557988167,
      "step": 6,
      "train_speed(iter/s)": 0.005427
    },
    {
      "epoch": 0.020008932559178204,
      "grad_norm": 10.019857406616211,
      "learning_rate": 2.641509433962264e-05,
      "logits/chosen": -0.6211694478988647,
      "logits/rejected": -0.6214967370033264,
      "logps/chosen": -6.935382843017578,
      "logps/rejected": -13.613279342651367,
      "loss": 1.2412631511688232,
      "memory(GiB)": 46.73,
      "nll_loss": 0.5651571154594421,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.13799861073493958,
      "rewards/margins": 0.053141627460718155,
      "rewards/rejected": 0.08485697209835052,
      "step": 7,
      "train_speed(iter/s)": 0.005441
    },
    {
      "epoch": 0.022867351496203663,
      "grad_norm": 6.375326633453369,
      "learning_rate": 3.018867924528302e-05,
      "logits/chosen": -0.6666778326034546,
      "logits/rejected": -0.6678147315979004,
      "logps/chosen": -8.114872932434082,
      "logps/rejected": -13.392560958862305,
      "loss": 1.1162137985229492,
      "memory(GiB)": 46.73,
      "nll_loss": 0.4446101784706116,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.20063960552215576,
      "rewards/margins": 0.09723334014415741,
      "rewards/rejected": 0.10340625792741776,
      "step": 8,
      "train_speed(iter/s)": 0.005426
    },
    {
      "epoch": 0.02572577043322912,
      "grad_norm": 4.046472549438477,
      "learning_rate": 3.39622641509434e-05,
      "logits/chosen": -0.5842044949531555,
      "logits/rejected": -0.5892153382301331,
      "logps/chosen": -13.877073287963867,
      "logps/rejected": -14.116576194763184,
      "loss": 1.259205937385559,
      "memory(GiB)": 46.73,
      "nll_loss": 0.5605449676513672,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": 0.1392103135585785,
      "rewards/margins": 0.09627523273229599,
      "rewards/rejected": 0.0429350808262825,
      "step": 9,
      "train_speed(iter/s)": 0.005422
    },
    {
      "epoch": 0.028584189370254576,
      "grad_norm": 7.625533103942871,
      "learning_rate": 3.7735849056603776e-05,
      "logits/chosen": -0.6210353374481201,
      "logits/rejected": -0.6224341988563538,
      "logps/chosen": -8.32575798034668,
      "logps/rejected": -11.715011596679688,
      "loss": 1.2772942781448364,
      "memory(GiB)": 46.73,
      "nll_loss": 0.48597079515457153,
      "rewards/accuracies": 0.4375,
      "rewards/chosen": -0.043191827833652496,
      "rewards/margins": 0.029505327343940735,
      "rewards/rejected": -0.07269717007875443,
      "step": 10,
      "train_speed(iter/s)": 0.005438
    },
    {
      "epoch": 0.03144260830728004,
      "grad_norm": 11.961934089660645,
      "learning_rate": 4.150943396226415e-05,
      "logits/chosen": -0.6265634298324585,
      "logits/rejected": -0.6289808750152588,
      "logps/chosen": -7.129470348358154,
      "logps/rejected": -11.932583808898926,
      "loss": 1.447466254234314,
      "memory(GiB)": 46.73,
      "nll_loss": 0.6552329659461975,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": -0.00290237320587039,
      "rewards/margins": 0.06162097677588463,
      "rewards/rejected": -0.0645233541727066,
      "step": 11,
      "train_speed(iter/s)": 0.005473
    },
    {
      "epoch": 0.03430102724430549,
      "grad_norm": 10.154479026794434,
      "learning_rate": 4.528301886792453e-05,
      "logits/chosen": -0.6388624906539917,
      "logits/rejected": -0.639370858669281,
      "logps/chosen": -9.490407943725586,
      "logps/rejected": -12.88676643371582,
      "loss": 1.4875458478927612,
      "memory(GiB)": 46.73,
      "nll_loss": 0.6468713283538818,
      "rewards/accuracies": 0.4375,
      "rewards/chosen": -0.10463112592697144,
      "rewards/margins": -0.059477299451828,
      "rewards/rejected": -0.04515381157398224,
      "step": 12,
      "train_speed(iter/s)": 0.005465
    },
    {
      "epoch": 0.03715944618133095,
      "grad_norm": 4.091860771179199,
      "learning_rate": 4.9056603773584906e-05,
      "logits/chosen": -0.6680133938789368,
      "logits/rejected": -0.6711105108261108,
      "logps/chosen": -5.56148099899292,
      "logps/rejected": -13.865943908691406,
      "loss": 1.0154482126235962,
      "memory(GiB)": 46.73,
      "nll_loss": 0.35444653034210205,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.12190410494804382,
      "rewards/margins": 0.3293726444244385,
      "rewards/rejected": -0.20746850967407227,
      "step": 13,
      "train_speed(iter/s)": 0.00546
    },
    {
      "epoch": 0.04001786511835641,
      "grad_norm": 3.039910316467285,
      "learning_rate": 5.283018867924528e-05,
      "logits/chosen": -0.6245446801185608,
      "logits/rejected": -0.6280595660209656,
      "logps/chosen": -7.042474269866943,
      "logps/rejected": -14.88280963897705,
      "loss": 0.9986085295677185,
      "memory(GiB)": 46.73,
      "nll_loss": 0.32772910594940186,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.08946945518255234,
      "rewards/margins": 0.2548743188381195,
      "rewards/rejected": -0.16540484130382538,
      "step": 14,
      "train_speed(iter/s)": 0.005463
    },
    {
      "epoch": 0.042876284055381866,
      "grad_norm": 2.8388617038726807,
      "learning_rate": 5.660377358490566e-05,
      "logits/chosen": -0.613956868648529,
      "logits/rejected": -0.6150951385498047,
      "logps/chosen": -5.398593902587891,
      "logps/rejected": -10.984697341918945,
      "loss": 0.9217166900634766,
      "memory(GiB)": 46.73,
      "nll_loss": 0.21436992287635803,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.2490297257900238,
      "rewards/margins": 0.12685683369636536,
      "rewards/rejected": 0.12217291444540024,
      "step": 15,
      "train_speed(iter/s)": 0.005464
    },
    {
      "epoch": 0.045734702992407325,
      "grad_norm": 3.623399257659912,
      "learning_rate": 6.037735849056604e-05,
      "logits/chosen": -0.5890456438064575,
      "logits/rejected": -0.5907201766967773,
      "logps/chosen": -7.65773868560791,
      "logps/rejected": -15.24480152130127,
      "loss": 1.130638837814331,
      "memory(GiB)": 46.73,
      "nll_loss": 0.33376482129096985,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": 0.14319562911987305,
      "rewards/margins": 0.01443251222372055,
      "rewards/rejected": 0.1287631392478943,
      "step": 16,
      "train_speed(iter/s)": 0.00546
    },
    {
      "epoch": 0.048593121929432784,
      "grad_norm": 2.9850075244903564,
      "learning_rate": 6.415094339622641e-05,
      "logits/chosen": -0.5228931903839111,
      "logits/rejected": -0.524716854095459,
      "logps/chosen": -10.135262489318848,
      "logps/rejected": -14.072588920593262,
      "loss": 1.2770482301712036,
      "memory(GiB)": 46.73,
      "nll_loss": 0.48515522480010986,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": 0.13618236780166626,
      "rewards/margins": -0.09462341666221619,
      "rewards/rejected": 0.23080575466156006,
      "step": 17,
      "train_speed(iter/s)": 0.005473
    },
    {
      "epoch": 0.05145154086645824,
      "grad_norm": 2.2746193408966064,
      "learning_rate": 6.79245283018868e-05,
      "logits/chosen": -0.5764032006263733,
      "logits/rejected": -0.5762047171592712,
      "logps/chosen": -11.675098419189453,
      "logps/rejected": -10.994297981262207,
      "loss": 1.2022521495819092,
      "memory(GiB)": 46.73,
      "nll_loss": 0.4671342372894287,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": 0.1593710482120514,
      "rewards/margins": -0.00844080001115799,
      "rewards/rejected": 0.1678118258714676,
      "step": 18,
      "train_speed(iter/s)": 0.005468
    },
    {
      "epoch": 0.0543099598034837,
      "grad_norm": 2.324984312057495,
      "learning_rate": 7.169811320754717e-05,
      "logits/chosen": -0.567690908908844,
      "logits/rejected": -0.569066047668457,
      "logps/chosen": -9.0728120803833,
      "logps/rejected": -12.268661499023438,
      "loss": 1.1060843467712402,
      "memory(GiB)": 46.73,
      "nll_loss": 0.41300466656684875,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": 0.23081830143928528,
      "rewards/margins": 0.0710553377866745,
      "rewards/rejected": 0.15976294875144958,
      "step": 19,
      "train_speed(iter/s)": 0.005463
    },
    {
      "epoch": 0.05716837874050915,
      "grad_norm": 2.0991458892822266,
      "learning_rate": 7.547169811320755e-05,
      "logits/chosen": -0.6091416478157043,
      "logits/rejected": -0.6100034117698669,
      "logps/chosen": -4.26762056350708,
      "logps/rejected": -11.32187557220459,
      "loss": 1.0021699666976929,
      "memory(GiB)": 46.73,
      "nll_loss": 0.2933175265789032,
      "rewards/accuracies": 0.4375,
      "rewards/chosen": 0.15655732154846191,
      "rewards/margins": 0.008277412503957748,
      "rewards/rejected": 0.14827993512153625,
      "step": 20,
      "train_speed(iter/s)": 0.005467
    },
    {
      "epoch": 0.06002679767753461,
      "grad_norm": 3.4958455562591553,
      "learning_rate": 7.924528301886794e-05,
      "logits/chosen": -0.571921706199646,
      "logits/rejected": -0.572878360748291,
      "logps/chosen": -9.612298965454102,
      "logps/rejected": -12.484085083007812,
      "loss": 1.1795949935913086,
      "memory(GiB)": 46.73,
      "nll_loss": 0.46760252118110657,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": 0.14643912017345428,
      "rewards/margins": 0.0200117826461792,
      "rewards/rejected": 0.12642733752727509,
      "step": 21,
      "train_speed(iter/s)": 0.005467
    },
    {
      "epoch": 0.06288521661456008,
      "grad_norm": 3.175546169281006,
      "learning_rate": 8.30188679245283e-05,
      "logits/chosen": -0.6108006834983826,
      "logits/rejected": -0.6111243367195129,
      "logps/chosen": -6.207424163818359,
      "logps/rejected": -7.818144798278809,
      "loss": 1.1549935340881348,
      "memory(GiB)": 46.73,
      "nll_loss": 0.4683927893638611,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": 0.23285990953445435,
      "rewards/margins": 0.06634702533483505,
      "rewards/rejected": 0.16651292145252228,
      "step": 22,
      "train_speed(iter/s)": 0.00547
    },
    {
      "epoch": 0.06574363555158554,
      "grad_norm": 2.4531869888305664,
      "learning_rate": 8.679245283018869e-05,
      "logits/chosen": -0.6012008190155029,
      "logits/rejected": -0.6021928191184998,
      "logps/chosen": -5.598664283752441,
      "logps/rejected": -13.262667655944824,
      "loss": 0.9260164499282837,
      "memory(GiB)": 46.73,
      "nll_loss": 0.33532270789146423,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.3285560607910156,
      "rewards/margins": 0.3157665431499481,
      "rewards/rejected": 0.012789532542228699,
      "step": 23,
      "train_speed(iter/s)": 0.005467
    },
    {
      "epoch": 0.06860205448861098,
      "grad_norm": 2.328031301498413,
      "learning_rate": 9.056603773584906e-05,
      "logits/chosen": -0.567432165145874,
      "logits/rejected": -0.5704118609428406,
      "logps/chosen": -4.026985168457031,
      "logps/rejected": -14.904813766479492,
      "loss": 0.8984246253967285,
      "memory(GiB)": 46.73,
      "nll_loss": 0.26223480701446533,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.26638248562812805,
      "rewards/margins": 0.22430934011936188,
      "rewards/rejected": 0.042073119431734085,
      "step": 24,
      "train_speed(iter/s)": 0.005466
    },
    {
      "epoch": 0.07146047342563644,
      "grad_norm": 3.5119378566741943,
      "learning_rate": 9.433962264150944e-05,
      "logits/chosen": -0.5709348320960999,
      "logits/rejected": -0.5688645243644714,
      "logps/chosen": -7.716845989227295,
      "logps/rejected": -7.868927955627441,
      "loss": 1.113297462463379,
      "memory(GiB)": 46.73,
      "nll_loss": 0.3660878837108612,
      "rewards/accuracies": 0.5,
      "rewards/chosen": 0.2273256480693817,
      "rewards/margins": -0.0022776294499635696,
      "rewards/rejected": 0.22960326075553894,
      "step": 25,
      "train_speed(iter/s)": 0.005475
    },
    {
      "epoch": 0.0743188923626619,
      "grad_norm": 3.2336673736572266,
      "learning_rate": 9.811320754716981e-05,
      "logits/chosen": -0.589956521987915,
      "logits/rejected": -0.587726354598999,
      "logps/chosen": -10.072855949401855,
      "logps/rejected": -12.857810974121094,
      "loss": 1.0991942882537842,
      "memory(GiB)": 46.73,
      "nll_loss": 0.40110355615615845,
      "rewards/accuracies": 0.5,
      "rewards/chosen": 0.17576897144317627,
      "rewards/margins": 0.11343260109424591,
      "rewards/rejected": 0.062336355447769165,
      "step": 26,
      "train_speed(iter/s)": 0.005466
    },
    {
      "epoch": 0.07717731129968736,
      "grad_norm": 2.6813321113586426,
      "learning_rate": 0.0001018867924528302,
      "logits/chosen": -0.5832359194755554,
      "logits/rejected": -0.5860565304756165,
      "logps/chosen": -8.197118759155273,
      "logps/rejected": -17.45244598388672,
      "loss": 0.8366767764091492,
      "memory(GiB)": 46.73,
      "nll_loss": 0.2886262536048889,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.3297504186630249,
      "rewards/margins": 0.48295390605926514,
      "rewards/rejected": -0.15320347249507904,
      "step": 27,
      "train_speed(iter/s)": 0.00547
    },
    {
      "epoch": 0.08003573023671282,
      "grad_norm": 3.3800203800201416,
      "learning_rate": 0.00010566037735849057,
      "logits/chosen": -0.6005962491035461,
      "logits/rejected": -0.6035608053207397,
      "logps/chosen": -9.117904663085938,
      "logps/rejected": -18.400161743164062,
      "loss": 1.0143071413040161,
      "memory(GiB)": 46.73,
      "nll_loss": 0.4276316463947296,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.271901398897171,
      "rewards/margins": 0.4319708049297333,
      "rewards/rejected": -0.16006940603256226,
      "step": 28,
      "train_speed(iter/s)": 0.005468
    },
    {
      "epoch": 0.08289414917373827,
      "grad_norm": 5.461134433746338,
      "learning_rate": 0.00010943396226415095,
      "logits/chosen": -0.5596082210540771,
      "logits/rejected": -0.5635167360305786,
      "logps/chosen": -7.607837200164795,
      "logps/rejected": -23.174358367919922,
      "loss": 0.803045928478241,
      "memory(GiB)": 46.73,
      "nll_loss": 0.32165294885635376,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.3834715783596039,
      "rewards/margins": 0.7214637994766235,
      "rewards/rejected": -0.33799219131469727,
      "step": 29,
      "train_speed(iter/s)": 0.005464
    },
    {
      "epoch": 0.08575256811076373,
      "grad_norm": 3.3377506732940674,
      "learning_rate": 0.00011320754716981132,
      "logits/chosen": -0.6003558039665222,
      "logits/rejected": -0.6016712188720703,
      "logps/chosen": -7.941157817840576,
      "logps/rejected": -10.564404487609863,
      "loss": 1.0737202167510986,
      "memory(GiB)": 46.73,
      "nll_loss": 0.3314566910266876,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.1379927098751068,
      "rewards/margins": 0.08670535683631897,
      "rewards/rejected": 0.05128733813762665,
      "step": 30,
      "train_speed(iter/s)": 0.005461
    },
    {
      "epoch": 0.08861098704778919,
      "grad_norm": 3.4214563369750977,
      "learning_rate": 0.0001169811320754717,
      "logits/chosen": -0.5186684727668762,
      "logits/rejected": -0.5189406275749207,
      "logps/chosen": -6.143683910369873,
      "logps/rejected": -25.88001251220703,
      "loss": 0.7792238593101501,
      "memory(GiB)": 46.73,
      "nll_loss": 0.2514691948890686,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.2757991552352905,
      "rewards/margins": 0.5156725645065308,
      "rewards/rejected": -0.23987337946891785,
      "step": 31,
      "train_speed(iter/s)": 0.005459
    },
    {
      "epoch": 0.09146940598481465,
      "grad_norm": 4.645272731781006,
      "learning_rate": 0.00012075471698113207,
      "logits/chosen": -0.5988867282867432,
      "logits/rejected": -0.6016397476196289,
      "logps/chosen": -5.776233673095703,
      "logps/rejected": -22.404544830322266,
      "loss": 0.8892383575439453,
      "memory(GiB)": 46.73,
      "nll_loss": 0.4011368155479431,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.22715790569782257,
      "rewards/margins": 0.7724226713180542,
      "rewards/rejected": -0.545264720916748,
      "step": 32,
      "train_speed(iter/s)": 0.005454
    },
    {
      "epoch": 0.09432782492184011,
      "grad_norm": 4.586422443389893,
      "learning_rate": 0.00012452830188679244,
      "logits/chosen": -0.5782912969589233,
      "logits/rejected": -0.5768243670463562,
      "logps/chosen": -10.939208984375,
      "logps/rejected": -13.486640930175781,
      "loss": 1.1607584953308105,
      "memory(GiB)": 46.73,
      "nll_loss": 0.5877886414527893,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.21317529678344727,
      "rewards/margins": 0.4141784906387329,
      "rewards/rejected": -0.20100319385528564,
      "step": 33,
      "train_speed(iter/s)": 0.005457
    },
    {
      "epoch": 0.09718624385886557,
      "grad_norm": 4.306042671203613,
      "learning_rate": 0.00012830188679245283,
      "logits/chosen": -0.6019578576087952,
      "logits/rejected": -0.6082974076271057,
      "logps/chosen": -7.5170578956604,
      "logps/rejected": -24.889406204223633,
      "loss": 0.9509016275405884,
      "memory(GiB)": 46.73,
      "nll_loss": 0.4247076213359833,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.10510760545730591,
      "rewards/margins": 0.8037927150726318,
      "rewards/rejected": -0.6986850500106812,
      "step": 34,
      "train_speed(iter/s)": 0.005456
    },
    {
      "epoch": 0.10004466279589103,
      "grad_norm": 3.002274751663208,
      "learning_rate": 0.0001320754716981132,
      "logits/chosen": -0.6133092641830444,
      "logits/rejected": -0.6127456426620483,
      "logps/chosen": -8.859593391418457,
      "logps/rejected": -17.02096939086914,
      "loss": 0.8848217129707336,
      "memory(GiB)": 46.73,
      "nll_loss": 0.3480006456375122,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.25863486528396606,
      "rewards/margins": 0.5611037015914917,
      "rewards/rejected": -0.302468866109848,
      "step": 35,
      "train_speed(iter/s)": 0.005457
    },
    {
      "epoch": 0.10290308173291648,
      "grad_norm": 4.299287796020508,
      "learning_rate": 0.0001358490566037736,
      "logits/chosen": -0.5725032091140747,
      "logits/rejected": -0.5725142359733582,
      "logps/chosen": -8.371686935424805,
      "logps/rejected": -17.657852172851562,
      "loss": 0.8825864791870117,
      "memory(GiB)": 46.73,
      "nll_loss": 0.3603641390800476,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.23154468834400177,
      "rewards/margins": 0.6240193843841553,
      "rewards/rejected": -0.3924746811389923,
      "step": 36,
      "train_speed(iter/s)": 0.005457
    },
    {
      "epoch": 0.10576150066994194,
      "grad_norm": 4.354315757751465,
      "learning_rate": 0.00013962264150943395,
      "logits/chosen": -0.5943324565887451,
      "logits/rejected": -0.5940991044044495,
      "logps/chosen": -7.657552719116211,
      "logps/rejected": -16.183917999267578,
      "loss": 0.8160735964775085,
      "memory(GiB)": 46.73,
      "nll_loss": 0.3588046133518219,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.27544379234313965,
      "rewards/margins": 0.7471473217010498,
      "rewards/rejected": -0.4717034101486206,
      "step": 37,
      "train_speed(iter/s)": 0.005452
    },
    {
      "epoch": 0.1086199196069674,
      "grad_norm": 7.916697978973389,
      "learning_rate": 0.00014339622641509434,
      "logits/chosen": -0.5676888227462769,
      "logits/rejected": -0.5714080929756165,
      "logps/chosen": -6.698662757873535,
      "logps/rejected": -17.954235076904297,
      "loss": 1.052018642425537,
      "memory(GiB)": 46.73,
      "nll_loss": 0.49374452233314514,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.16338011622428894,
      "rewards/margins": 0.42942774295806885,
      "rewards/rejected": -0.2660475969314575,
      "step": 38,
      "train_speed(iter/s)": 0.005452
    },
    {
      "epoch": 0.11147833854399285,
      "grad_norm": 3.7271363735198975,
      "learning_rate": 0.00014716981132075472,
      "logits/chosen": -0.6097766160964966,
      "logits/rejected": -0.6135396957397461,
      "logps/chosen": -7.30006217956543,
      "logps/rejected": -22.168495178222656,
      "loss": 0.7729511857032776,
      "memory(GiB)": 46.73,
      "nll_loss": 0.3125499188899994,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.28066012263298035,
      "rewards/margins": 0.8108583092689514,
      "rewards/rejected": -0.5301981568336487,
      "step": 39,
      "train_speed(iter/s)": 0.00545
    },
    {
      "epoch": 0.1143367574810183,
      "grad_norm": 2.960145950317383,
      "learning_rate": 0.0001509433962264151,
      "logits/chosen": -0.6132208108901978,
      "logits/rejected": -0.6163071990013123,
      "logps/chosen": -7.024638652801514,
      "logps/rejected": -21.298852920532227,
      "loss": 0.8106734752655029,
      "memory(GiB)": 46.73,
      "nll_loss": 0.37238579988479614,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.39458420872688293,
      "rewards/margins": 0.8476477265357971,
      "rewards/rejected": -0.45306357741355896,
      "step": 40,
      "train_speed(iter/s)": 0.005445
    },
    {
      "epoch": 0.11719517641804376,
      "grad_norm": 4.3203630447387695,
      "learning_rate": 0.0001547169811320755,
      "logits/chosen": -0.5976248979568481,
      "logits/rejected": -0.6002449989318848,
      "logps/chosen": -5.656615257263184,
      "logps/rejected": -16.032827377319336,
      "loss": 0.9440045952796936,
      "memory(GiB)": 46.73,
      "nll_loss": 0.33253738284111023,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.14414586126804352,
      "rewards/margins": 0.5006409287452698,
      "rewards/rejected": -0.35649505257606506,
      "step": 41,
      "train_speed(iter/s)": 0.005445
    },
    {
      "epoch": 0.12005359535506922,
      "grad_norm": 4.646491527557373,
      "learning_rate": 0.00015849056603773587,
      "logits/chosen": -0.5956608653068542,
      "logits/rejected": -0.5956603288650513,
      "logps/chosen": -11.719463348388672,
      "logps/rejected": -27.070579528808594,
      "loss": 1.0076483488082886,
      "memory(GiB)": 46.73,
      "nll_loss": 0.5070124268531799,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.15291725099086761,
      "rewards/margins": 0.7710469961166382,
      "rewards/rejected": -0.6181297898292542,
      "step": 42,
      "train_speed(iter/s)": 0.005446
    },
    {
      "epoch": 0.12291201429209468,
      "grad_norm": 4.248917102813721,
      "learning_rate": 0.00016226415094339625,
      "logits/chosen": -0.6100150942802429,
      "logits/rejected": -0.6142972111701965,
      "logps/chosen": -6.201865196228027,
      "logps/rejected": -19.82131004333496,
      "loss": 0.7969534993171692,
      "memory(GiB)": 46.73,
      "nll_loss": 0.31225427985191345,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.20218679308891296,
      "rewards/margins": 0.705444872379303,
      "rewards/rejected": -0.5032580494880676,
      "step": 43,
      "train_speed(iter/s)": 0.005448
    },
    {
      "epoch": 0.12577043322912015,
      "grad_norm": 3.1864066123962402,
      "learning_rate": 0.0001660377358490566,
      "logits/chosen": -0.6078452467918396,
      "logits/rejected": -0.6100336909294128,
      "logps/chosen": -8.217609405517578,
      "logps/rejected": -18.432086944580078,
      "loss": 0.945781409740448,
      "memory(GiB)": 46.73,
      "nll_loss": 0.4447736442089081,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.16747131943702698,
      "rewards/margins": 0.6352076530456543,
      "rewards/rejected": -0.46773630380630493,
      "step": 44,
      "train_speed(iter/s)": 0.005451
    },
    {
      "epoch": 0.1286288521661456,
      "grad_norm": 2.8247904777526855,
      "learning_rate": 0.000169811320754717,
      "logits/chosen": -0.6424505710601807,
      "logits/rejected": -0.6455634236335754,
      "logps/chosen": -4.626930236816406,
      "logps/rejected": -18.966289520263672,
      "loss": 0.6525614261627197,
      "memory(GiB)": 46.73,
      "nll_loss": 0.20949943363666534,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": 0.1935967355966568,
      "rewards/margins": 0.7181073427200317,
      "rewards/rejected": -0.5245105624198914,
      "step": 45,
      "train_speed(iter/s)": 0.005449
    },
    {
      "epoch": 0.13148727110317107,
      "grad_norm": 5.167090892791748,
      "learning_rate": 0.00017358490566037738,
      "logits/chosen": -0.6390554308891296,
      "logits/rejected": -0.6455981731414795,
      "logps/chosen": -7.457905292510986,
      "logps/rejected": -22.238759994506836,
      "loss": 0.7052859663963318,
      "memory(GiB)": 46.73,
      "nll_loss": 0.3145278990268707,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": 0.3406547009944916,
      "rewards/margins": 0.9184964895248413,
      "rewards/rejected": -0.5778417587280273,
      "step": 46,
      "train_speed(iter/s)": 0.005446
    },
    {
      "epoch": 0.1343456900401965,
      "grad_norm": 3.110797166824341,
      "learning_rate": 0.00017735849056603776,
      "logits/chosen": -0.6957284212112427,
      "logits/rejected": -0.6984925866127014,
      "logps/chosen": -6.335500717163086,
      "logps/rejected": -26.946069717407227,
      "loss": 0.6684616804122925,
      "memory(GiB)": 46.73,
      "nll_loss": 0.27696001529693604,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.36519789695739746,
      "rewards/margins": 1.261197805404663,
      "rewards/rejected": -0.8960000276565552,
      "step": 47,
      "train_speed(iter/s)": 0.005445
    },
    {
      "epoch": 0.13720410897722196,
      "grad_norm": 5.592209815979004,
      "learning_rate": 0.00018113207547169812,
      "logits/chosen": -0.6557337641716003,
      "logits/rejected": -0.6595371961593628,
      "logps/chosen": -6.262232780456543,
      "logps/rejected": -22.550495147705078,
      "loss": 0.844598650932312,
      "memory(GiB)": 46.73,
      "nll_loss": 0.32042089104652405,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.098446786403656,
      "rewards/margins": 1.1042643785476685,
      "rewards/rejected": -1.0058175325393677,
      "step": 48,
      "train_speed(iter/s)": 0.005444
    },
    {
      "epoch": 0.14006252791424742,
      "grad_norm": 5.518631458282471,
      "learning_rate": 0.0001849056603773585,
      "logits/chosen": -0.7261903285980225,
      "logits/rejected": -0.7333111763000488,
      "logps/chosen": -6.155282020568848,
      "logps/rejected": -28.635177612304688,
      "loss": 0.7839219570159912,
      "memory(GiB)": 46.73,
      "nll_loss": 0.3167538046836853,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.18123595416545868,
      "rewards/margins": 1.343546986579895,
      "rewards/rejected": -1.1623109579086304,
      "step": 49,
      "train_speed(iter/s)": 0.00544
    },
    {
      "epoch": 0.14292094685127288,
      "grad_norm": 5.368433475494385,
      "learning_rate": 0.00018867924528301889,
      "logits/chosen": -0.7460846304893494,
      "logits/rejected": -0.7433331608772278,
      "logps/chosen": -8.476225852966309,
      "logps/rejected": -20.479339599609375,
      "loss": 1.041689395904541,
      "memory(GiB)": 46.73,
      "nll_loss": 0.5162184834480286,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.07575411349534988,
      "rewards/margins": 0.8544278144836426,
      "rewards/rejected": -0.7786736488342285,
      "step": 50,
      "train_speed(iter/s)": 0.005439
    }
  ],
  "logging_steps": 1,
  "max_steps": 1047,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 3,
  "save_steps": 50,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 3.488196344152064e+17,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}