PEFT
Safetensors
File size: 32,671 Bytes
8dd6fe0
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.12982797792924375,
  "eval_steps": 300,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.002596559558584875,
      "grad_norm": 4.769598007202148,
      "learning_rate": 5.128205128205128e-06,
      "logits/chosen": -0.5944205522537231,
      "logits/rejected": -0.5917393565177917,
      "logps/chosen": -11.821638107299805,
      "logps/rejected": -10.731678009033203,
      "loss": 1.193467140197754,
      "memory(GiB)": 46.82,
      "nll_loss": 0.50031977891922,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 1,
      "train_speed(iter/s)": 0.004987
    },
    {
      "epoch": 0.00519311911716975,
      "grad_norm": 7.638933181762695,
      "learning_rate": 1.0256410256410256e-05,
      "logits/chosen": -0.6539207696914673,
      "logits/rejected": -0.6607442498207092,
      "logps/chosen": -9.628549575805664,
      "logps/rejected": -15.572840690612793,
      "loss": 1.1913397312164307,
      "memory(GiB)": 46.82,
      "nll_loss": 0.4981924891471863,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 2,
      "train_speed(iter/s)": 0.005274
    },
    {
      "epoch": 0.007789678675754625,
      "grad_norm": 8.172294616699219,
      "learning_rate": 1.5384615384615387e-05,
      "logits/chosen": -0.6215255260467529,
      "logits/rejected": -0.6243188381195068,
      "logps/chosen": -10.225044250488281,
      "logps/rejected": -12.433060646057129,
      "loss": 1.3010810613632202,
      "memory(GiB)": 46.82,
      "nll_loss": 0.6032217741012573,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": -0.002520320238545537,
      "rewards/margins": -0.00917358510196209,
      "rewards/rejected": 0.006653264630585909,
      "step": 3,
      "train_speed(iter/s)": 0.005242
    },
    {
      "epoch": 0.0103862382343395,
      "grad_norm": 7.314579010009766,
      "learning_rate": 2.0512820512820512e-05,
      "logits/chosen": -0.6062605381011963,
      "logits/rejected": -0.6072395443916321,
      "logps/chosen": -9.956047058105469,
      "logps/rejected": -11.640246391296387,
      "loss": 1.2542610168457031,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5589770674705505,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": 0.007420660927891731,
      "rewards/margins": -0.004003261215984821,
      "rewards/rejected": 0.011423922143876553,
      "step": 4,
      "train_speed(iter/s)": 0.005268
    },
    {
      "epoch": 0.012982797792924375,
      "grad_norm": 3.7953975200653076,
      "learning_rate": 2.564102564102564e-05,
      "logits/chosen": -0.5976298451423645,
      "logits/rejected": -0.5966740846633911,
      "logps/chosen": -13.070164680480957,
      "logps/rejected": -9.661067008972168,
      "loss": 1.215171456336975,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5106430649757385,
      "rewards/accuracies": 0.375,
      "rewards/chosen": 0.00016488437540829182,
      "rewards/margins": -0.020555444061756134,
      "rewards/rejected": 0.02072032354772091,
      "step": 5,
      "train_speed(iter/s)": 0.00529
    },
    {
      "epoch": 0.01557935735150925,
      "grad_norm": 7.202587604522705,
      "learning_rate": 3.0769230769230774e-05,
      "logits/chosen": -0.6029255390167236,
      "logits/rejected": -0.6082680225372314,
      "logps/chosen": -6.68419075012207,
      "logps/rejected": -14.836040496826172,
      "loss": 1.1022435426712036,
      "memory(GiB)": 46.82,
      "nll_loss": 0.4213921129703522,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.05949082225561142,
      "rewards/margins": 0.03669985011219978,
      "rewards/rejected": 0.02279096469283104,
      "step": 6,
      "train_speed(iter/s)": 0.00532
    },
    {
      "epoch": 0.018175916910094125,
      "grad_norm": 4.17504358291626,
      "learning_rate": 3.58974358974359e-05,
      "logits/chosen": -0.5737150311470032,
      "logits/rejected": -0.5751169919967651,
      "logps/chosen": -10.05550479888916,
      "logps/rejected": -10.229061126708984,
      "loss": 1.1968086957931519,
      "memory(GiB)": 46.82,
      "nll_loss": 0.451814740896225,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": 0.018731240183115005,
      "rewards/margins": -0.06073049083352089,
      "rewards/rejected": 0.0794617310166359,
      "step": 7,
      "train_speed(iter/s)": 0.005319
    },
    {
      "epoch": 0.020772476468679,
      "grad_norm": 4.966729164123535,
      "learning_rate": 4.1025641025641023e-05,
      "logits/chosen": -0.6149957180023193,
      "logits/rejected": -0.619285523891449,
      "logps/chosen": -10.129886627197266,
      "logps/rejected": -14.14559268951416,
      "loss": 1.1496262550354004,
      "memory(GiB)": 46.82,
      "nll_loss": 0.45597678422927856,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -0.048677604645490646,
      "rewards/margins": 0.07307372987270355,
      "rewards/rejected": -0.1217513307929039,
      "step": 8,
      "train_speed(iter/s)": 0.005322
    },
    {
      "epoch": 0.023369036027263874,
      "grad_norm": 4.258759021759033,
      "learning_rate": 4.615384615384616e-05,
      "logits/chosen": -0.6464206576347351,
      "logits/rejected": -0.649814248085022,
      "logps/chosen": -6.2765960693359375,
      "logps/rejected": -14.259992599487305,
      "loss": 0.9683928489685059,
      "memory(GiB)": 46.82,
      "nll_loss": 0.27603328227996826,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -0.028385277837514877,
      "rewards/margins": 0.1275366246700287,
      "rewards/rejected": -0.15592190623283386,
      "step": 9,
      "train_speed(iter/s)": 0.005346
    },
    {
      "epoch": 0.02596559558584875,
      "grad_norm": 3.5765655040740967,
      "learning_rate": 5.128205128205128e-05,
      "logits/chosen": -0.5905835628509521,
      "logits/rejected": -0.5969584584236145,
      "logps/chosen": -14.795049667358398,
      "logps/rejected": -15.656811714172363,
      "loss": 1.238275408744812,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5923190116882324,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": -0.012541369535028934,
      "rewards/margins": 0.1883796602487564,
      "rewards/rejected": -0.20092105865478516,
      "step": 10,
      "train_speed(iter/s)": 0.005347
    },
    {
      "epoch": 0.028562155144433627,
      "grad_norm": 5.3241682052612305,
      "learning_rate": 5.6410256410256414e-05,
      "logits/chosen": -0.5469571948051453,
      "logits/rejected": -0.5478999614715576,
      "logps/chosen": -11.43381118774414,
      "logps/rejected": -13.521588325500488,
      "loss": 1.2181414365768433,
      "memory(GiB)": 46.82,
      "nll_loss": 0.4799095690250397,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -0.11080781370401382,
      "rewards/margins": -0.000970199704170227,
      "rewards/rejected": -0.109837606549263,
      "step": 11,
      "train_speed(iter/s)": 0.005357
    },
    {
      "epoch": 0.0311587147030185,
      "grad_norm": 3.739349126815796,
      "learning_rate": 6.153846153846155e-05,
      "logits/chosen": -0.5663439631462097,
      "logits/rejected": -0.5685043931007385,
      "logps/chosen": -9.113786697387695,
      "logps/rejected": -12.898387908935547,
      "loss": 1.1865863800048828,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5080631971359253,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.07351399958133698,
      "rewards/margins": 0.09553620219230652,
      "rewards/rejected": -0.022022202610969543,
      "step": 12,
      "train_speed(iter/s)": 0.00536
    },
    {
      "epoch": 0.03375527426160337,
      "grad_norm": 2.732536792755127,
      "learning_rate": 6.666666666666667e-05,
      "logits/chosen": -0.6258959770202637,
      "logits/rejected": -0.628243088722229,
      "logps/chosen": -11.908061027526855,
      "logps/rejected": -14.742002487182617,
      "loss": 1.0720946788787842,
      "memory(GiB)": 46.82,
      "nll_loss": 0.44474831223487854,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.0872192531824112,
      "rewards/margins": 0.16859112679958344,
      "rewards/rejected": -0.08137187361717224,
      "step": 13,
      "train_speed(iter/s)": 0.005365
    },
    {
      "epoch": 0.03635183382018825,
      "grad_norm": 2.286402702331543,
      "learning_rate": 7.17948717948718e-05,
      "logits/chosen": -0.5518996119499207,
      "logits/rejected": -0.5536460280418396,
      "logps/chosen": -7.985256195068359,
      "logps/rejected": -9.997514724731445,
      "loss": 1.0465917587280273,
      "memory(GiB)": 46.82,
      "nll_loss": 0.37517642974853516,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": 0.09782104939222336,
      "rewards/margins": 0.08964069932699203,
      "rewards/rejected": 0.008180351927876472,
      "step": 14,
      "train_speed(iter/s)": 0.005362
    },
    {
      "epoch": 0.03894839337877313,
      "grad_norm": 2.8793153762817383,
      "learning_rate": 7.692307692307693e-05,
      "logits/chosen": -0.5976672172546387,
      "logits/rejected": -0.5990516543388367,
      "logps/chosen": -11.681562423706055,
      "logps/rejected": -15.269111633300781,
      "loss": 1.0413833856582642,
      "memory(GiB)": 46.82,
      "nll_loss": 0.44159939885139465,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.18112002313137054,
      "rewards/margins": 0.246211975812912,
      "rewards/rejected": -0.06509192287921906,
      "step": 15,
      "train_speed(iter/s)": 0.005369
    },
    {
      "epoch": 0.041544952937358,
      "grad_norm": 3.362415313720703,
      "learning_rate": 8.205128205128205e-05,
      "logits/chosen": -0.6091838479042053,
      "logits/rejected": -0.6097983717918396,
      "logps/chosen": -6.9782915115356445,
      "logps/rejected": -9.985608100891113,
      "loss": 1.0336495637893677,
      "memory(GiB)": 46.82,
      "nll_loss": 0.3420756161212921,
      "rewards/accuracies": 0.5,
      "rewards/chosen": 0.05590391904115677,
      "rewards/margins": 0.03598181903362274,
      "rewards/rejected": 0.019922103732824326,
      "step": 16,
      "train_speed(iter/s)": 0.005368
    },
    {
      "epoch": 0.04414151249594288,
      "grad_norm": 2.314833641052246,
      "learning_rate": 8.717948717948718e-05,
      "logits/chosen": -0.6001038551330566,
      "logits/rejected": -0.6009984612464905,
      "logps/chosen": -8.711943626403809,
      "logps/rejected": -8.347241401672363,
      "loss": 1.0018643140792847,
      "memory(GiB)": 46.82,
      "nll_loss": 0.3586280345916748,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": 0.17141370475292206,
      "rewards/margins": 0.15122823417186737,
      "rewards/rejected": 0.020185478031635284,
      "step": 17,
      "train_speed(iter/s)": 0.005365
    },
    {
      "epoch": 0.04673807205452775,
      "grad_norm": 2.6080470085144043,
      "learning_rate": 9.230769230769232e-05,
      "logits/chosen": -0.6079075932502747,
      "logits/rejected": -0.6091002225875854,
      "logps/chosen": -9.866250991821289,
      "logps/rejected": -9.885502815246582,
      "loss": 1.0599387884140015,
      "memory(GiB)": 46.82,
      "nll_loss": 0.3953135013580322,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.1653863787651062,
      "rewards/margins": 0.13114988803863525,
      "rewards/rejected": 0.03423647955060005,
      "step": 18,
      "train_speed(iter/s)": 0.005363
    },
    {
      "epoch": 0.04933463161311263,
      "grad_norm": 2.5750620365142822,
      "learning_rate": 9.743589743589744e-05,
      "logits/chosen": -0.5754107236862183,
      "logits/rejected": -0.5755229592323303,
      "logps/chosen": -9.663117408752441,
      "logps/rejected": -14.233282089233398,
      "loss": 0.9537867307662964,
      "memory(GiB)": 46.82,
      "nll_loss": 0.35284289717674255,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.12623246014118195,
      "rewards/margins": 0.24378177523612976,
      "rewards/rejected": -0.11754930019378662,
      "step": 19,
      "train_speed(iter/s)": 0.00537
    },
    {
      "epoch": 0.0519311911716975,
      "grad_norm": 4.289522171020508,
      "learning_rate": 0.00010256410256410256,
      "logits/chosen": -0.5981144905090332,
      "logits/rejected": -0.6002673506736755,
      "logps/chosen": -8.273541450500488,
      "logps/rejected": -12.811166763305664,
      "loss": 1.422603964805603,
      "memory(GiB)": 46.82,
      "nll_loss": 0.8183298707008362,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.21172407269477844,
      "rewards/margins": 0.2575765550136566,
      "rewards/rejected": -0.04585248976945877,
      "step": 20,
      "train_speed(iter/s)": 0.005365
    },
    {
      "epoch": 0.054527750730282376,
      "grad_norm": 2.396873712539673,
      "learning_rate": 0.0001076923076923077,
      "logits/chosen": -0.5655781030654907,
      "logits/rejected": -0.5672769546508789,
      "logps/chosen": -7.642134189605713,
      "logps/rejected": -16.37198257446289,
      "loss": 0.8944156765937805,
      "memory(GiB)": 46.82,
      "nll_loss": 0.28976452350616455,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.2191261202096939,
      "rewards/margins": 0.2641218602657318,
      "rewards/rejected": -0.04499572888016701,
      "step": 21,
      "train_speed(iter/s)": 0.005364
    },
    {
      "epoch": 0.057124310288867254,
      "grad_norm": 3.0281121730804443,
      "learning_rate": 0.00011282051282051283,
      "logits/chosen": -0.5596702694892883,
      "logits/rejected": -0.5609368681907654,
      "logps/chosen": -7.446313381195068,
      "logps/rejected": -12.651912689208984,
      "loss": 0.9526722431182861,
      "memory(GiB)": 46.82,
      "nll_loss": 0.33721715211868286,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.15709233283996582,
      "rewards/margins": 0.2245473712682724,
      "rewards/rejected": -0.06745504587888718,
      "step": 22,
      "train_speed(iter/s)": 0.005362
    },
    {
      "epoch": 0.059720869847452125,
      "grad_norm": 2.6955020427703857,
      "learning_rate": 0.00011794871794871796,
      "logits/chosen": -0.5400959849357605,
      "logits/rejected": -0.5422949194908142,
      "logps/chosen": -6.002541542053223,
      "logps/rejected": -12.28770637512207,
      "loss": 0.9044801592826843,
      "memory(GiB)": 46.82,
      "nll_loss": 0.2814594805240631,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.11246027797460556,
      "rewards/margins": 0.21622154116630554,
      "rewards/rejected": -0.10376127809286118,
      "step": 23,
      "train_speed(iter/s)": 0.005363
    },
    {
      "epoch": 0.062317429406037,
      "grad_norm": 3.1954290866851807,
      "learning_rate": 0.0001230769230769231,
      "logits/chosen": -0.5763551592826843,
      "logits/rejected": -0.5829795598983765,
      "logps/chosen": -8.22636890411377,
      "logps/rejected": -12.94092845916748,
      "loss": 0.9596253037452698,
      "memory(GiB)": 46.82,
      "nll_loss": 0.3679075837135315,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.17844173312187195,
      "rewards/margins": 0.2646990418434143,
      "rewards/rejected": -0.08625732362270355,
      "step": 24,
      "train_speed(iter/s)": 0.005367
    },
    {
      "epoch": 0.06491398896462187,
      "grad_norm": 3.440917730331421,
      "learning_rate": 0.00012820512820512823,
      "logits/chosen": -0.5423401594161987,
      "logits/rejected": -0.5454680919647217,
      "logps/chosen": -6.751742362976074,
      "logps/rejected": -14.677633285522461,
      "loss": 0.8222842216491699,
      "memory(GiB)": 46.82,
      "nll_loss": 0.2530384063720703,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.20278047025203705,
      "rewards/margins": 0.37300848960876465,
      "rewards/rejected": -0.1702280342578888,
      "step": 25,
      "train_speed(iter/s)": 0.005363
    },
    {
      "epoch": 0.06751054852320675,
      "grad_norm": 7.046718120574951,
      "learning_rate": 0.00013333333333333334,
      "logits/chosen": -0.531994640827179,
      "logits/rejected": -0.5324733257293701,
      "logps/chosen": -7.691443920135498,
      "logps/rejected": -12.912195205688477,
      "loss": 0.8851491212844849,
      "memory(GiB)": 46.82,
      "nll_loss": 0.2668984532356262,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.03996456041932106,
      "rewards/margins": 0.30043962597846985,
      "rewards/rejected": -0.2604750692844391,
      "step": 26,
      "train_speed(iter/s)": 0.005354
    },
    {
      "epoch": 0.07010710808179163,
      "grad_norm": 3.7837774753570557,
      "learning_rate": 0.00013846153846153847,
      "logits/chosen": -0.5356835722923279,
      "logits/rejected": -0.535167932510376,
      "logps/chosen": -7.836236476898193,
      "logps/rejected": -12.5257568359375,
      "loss": 0.9785585999488831,
      "memory(GiB)": 46.82,
      "nll_loss": 0.39958691596984863,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.11726226657629013,
      "rewards/margins": 0.30467987060546875,
      "rewards/rejected": -0.18741759657859802,
      "step": 27,
      "train_speed(iter/s)": 0.005353
    },
    {
      "epoch": 0.0727036676403765,
      "grad_norm": 2.986128568649292,
      "learning_rate": 0.0001435897435897436,
      "logits/chosen": -0.5374022126197815,
      "logits/rejected": -0.5330510139465332,
      "logps/chosen": -10.774028778076172,
      "logps/rejected": -10.21718692779541,
      "loss": 1.0210673809051514,
      "memory(GiB)": 46.82,
      "nll_loss": 0.44256913661956787,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.08123424649238586,
      "rewards/margins": 0.32150229811668396,
      "rewards/rejected": -0.2402680516242981,
      "step": 28,
      "train_speed(iter/s)": 0.00536
    },
    {
      "epoch": 0.07530022719896137,
      "grad_norm": 8.227151870727539,
      "learning_rate": 0.00014871794871794872,
      "logits/chosen": -0.555951714515686,
      "logits/rejected": -0.5587239265441895,
      "logps/chosen": -7.656264781951904,
      "logps/rejected": -16.2135066986084,
      "loss": 1.024498701095581,
      "memory(GiB)": 46.82,
      "nll_loss": 0.467337429523468,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.1679726243019104,
      "rewards/margins": 0.43920189142227173,
      "rewards/rejected": -0.2712292969226837,
      "step": 29,
      "train_speed(iter/s)": 0.005367
    },
    {
      "epoch": 0.07789678675754626,
      "grad_norm": 3.866678476333618,
      "learning_rate": 0.00015384615384615385,
      "logits/chosen": -0.5329037308692932,
      "logits/rejected": -0.5308660864830017,
      "logps/chosen": -13.327455520629883,
      "logps/rejected": -12.309192657470703,
      "loss": 1.1753352880477905,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5743139386177063,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.10232796519994736,
      "rewards/margins": 0.27346518635749817,
      "rewards/rejected": -0.1711372286081314,
      "step": 30,
      "train_speed(iter/s)": 0.00537
    },
    {
      "epoch": 0.08049334631613113,
      "grad_norm": 2.7835240364074707,
      "learning_rate": 0.00015897435897435896,
      "logits/chosen": -0.5286478996276855,
      "logits/rejected": -0.5297562479972839,
      "logps/chosen": -8.105016708374023,
      "logps/rejected": -18.577655792236328,
      "loss": 0.8083048462867737,
      "memory(GiB)": 46.82,
      "nll_loss": 0.3598409593105316,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.3429361879825592,
      "rewards/margins": 0.6762320399284363,
      "rewards/rejected": -0.3332958221435547,
      "step": 31,
      "train_speed(iter/s)": 0.005368
    },
    {
      "epoch": 0.083089905874716,
      "grad_norm": 2.621320962905884,
      "learning_rate": 0.0001641025641025641,
      "logits/chosen": -0.5535257458686829,
      "logits/rejected": -0.5577558279037476,
      "logps/chosen": -7.381773948669434,
      "logps/rejected": -20.8293514251709,
      "loss": 0.7857053279876709,
      "memory(GiB)": 46.82,
      "nll_loss": 0.3121376037597656,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.11771110445261002,
      "rewards/margins": 0.6395547389984131,
      "rewards/rejected": -0.5218436121940613,
      "step": 32,
      "train_speed(iter/s)": 0.005373
    },
    {
      "epoch": 0.08568646543330087,
      "grad_norm": 5.273679256439209,
      "learning_rate": 0.00016923076923076923,
      "logits/chosen": -0.5348193645477295,
      "logits/rejected": -0.5335426330566406,
      "logps/chosen": -16.012008666992188,
      "logps/rejected": -16.090946197509766,
      "loss": 1.150058388710022,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5311561822891235,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.09080329537391663,
      "rewards/margins": 0.3698381185531616,
      "rewards/rejected": -0.46064135432243347,
      "step": 33,
      "train_speed(iter/s)": 0.005375
    },
    {
      "epoch": 0.08828302499188576,
      "grad_norm": 3.7380588054656982,
      "learning_rate": 0.00017435897435897436,
      "logits/chosen": -0.526316225528717,
      "logits/rejected": -0.5241590738296509,
      "logps/chosen": -13.188718795776367,
      "logps/rejected": -18.877933502197266,
      "loss": 0.8901183009147644,
      "memory(GiB)": 46.82,
      "nll_loss": 0.4010193347930908,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.13551224768161774,
      "rewards/margins": 0.7849555015563965,
      "rewards/rejected": -0.6494433283805847,
      "step": 34,
      "train_speed(iter/s)": 0.005376
    },
    {
      "epoch": 0.09087958455047063,
      "grad_norm": 3.2903590202331543,
      "learning_rate": 0.0001794871794871795,
      "logits/chosen": -0.5694751739501953,
      "logits/rejected": -0.5714199542999268,
      "logps/chosen": -13.836735725402832,
      "logps/rejected": -17.397571563720703,
      "loss": 0.9489783644676208,
      "memory(GiB)": 46.82,
      "nll_loss": 0.4817684292793274,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.17933052778244019,
      "rewards/margins": 0.7199034690856934,
      "rewards/rejected": -0.5405729413032532,
      "step": 35,
      "train_speed(iter/s)": 0.005374
    },
    {
      "epoch": 0.0934761441090555,
      "grad_norm": 7.443658351898193,
      "learning_rate": 0.00018461538461538463,
      "logits/chosen": -0.5579850077629089,
      "logits/rejected": -0.5598161220550537,
      "logps/chosen": -9.724953651428223,
      "logps/rejected": -19.001192092895508,
      "loss": 1.025741696357727,
      "memory(GiB)": 46.82,
      "nll_loss": 0.4933169484138489,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.09439410269260406,
      "rewards/margins": 0.531223714351654,
      "rewards/rejected": -0.4368295967578888,
      "step": 36,
      "train_speed(iter/s)": 0.005367
    },
    {
      "epoch": 0.09607270366764038,
      "grad_norm": 4.221776962280273,
      "learning_rate": 0.00018974358974358974,
      "logits/chosen": -0.5673465728759766,
      "logits/rejected": -0.568681001663208,
      "logps/chosen": -7.996758937835693,
      "logps/rejected": -16.828737258911133,
      "loss": 0.768932044506073,
      "memory(GiB)": 46.82,
      "nll_loss": 0.3632465600967407,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": 0.20153376460075378,
      "rewards/margins": 0.8081123232841492,
      "rewards/rejected": -0.6065785884857178,
      "step": 37,
      "train_speed(iter/s)": 0.00536
    },
    {
      "epoch": 0.09866926322622525,
      "grad_norm": 4.438755989074707,
      "learning_rate": 0.00019487179487179487,
      "logits/chosen": -0.5432108640670776,
      "logits/rejected": -0.5440645217895508,
      "logps/chosen": -11.19113826751709,
      "logps/rejected": -16.801233291625977,
      "loss": 0.9643179178237915,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5330875515937805,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.212477445602417,
      "rewards/margins": 0.7622401714324951,
      "rewards/rejected": -0.5497627258300781,
      "step": 38,
      "train_speed(iter/s)": 0.005362
    },
    {
      "epoch": 0.10126582278481013,
      "grad_norm": 3.844766855239868,
      "learning_rate": 0.0002,
      "logits/chosen": -0.5104550719261169,
      "logits/rejected": -0.5119606852531433,
      "logps/chosen": -11.040297508239746,
      "logps/rejected": -18.91219711303711,
      "loss": 0.9704711437225342,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5230136513710022,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.14157143235206604,
      "rewards/margins": 0.7000695466995239,
      "rewards/rejected": -0.5584981441497803,
      "step": 39,
      "train_speed(iter/s)": 0.005358
    },
    {
      "epoch": 0.103862382343395,
      "grad_norm": 5.2911272048950195,
      "learning_rate": 0.00019999907650547008,
      "logits/chosen": -0.563255250453949,
      "logits/rejected": -0.5627263784408569,
      "logps/chosen": -8.962218284606934,
      "logps/rejected": -20.214658737182617,
      "loss": 0.9730861783027649,
      "memory(GiB)": 46.82,
      "nll_loss": 0.4494069516658783,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.03735905885696411,
      "rewards/margins": 0.7039426565170288,
      "rewards/rejected": -0.6665836572647095,
      "step": 40,
      "train_speed(iter/s)": 0.00536
    },
    {
      "epoch": 0.10645894190197988,
      "grad_norm": 3.2932822704315186,
      "learning_rate": 0.0001999963060389371,
      "logits/chosen": -0.49407708644866943,
      "logits/rejected": -0.4951040744781494,
      "logps/chosen": -4.336781978607178,
      "logps/rejected": -23.352622985839844,
      "loss": 0.5769761800765991,
      "memory(GiB)": 46.82,
      "nll_loss": 0.21373578906059265,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.2602457106113434,
      "rewards/margins": 1.0540037155151367,
      "rewards/rejected": -0.7937580347061157,
      "step": 41,
      "train_speed(iter/s)": 0.005359
    },
    {
      "epoch": 0.10905550146056475,
      "grad_norm": 3.550082206726074,
      "learning_rate": 0.00019999168865157137,
      "logits/chosen": -0.5316025018692017,
      "logits/rejected": -0.5340486764907837,
      "logps/chosen": -8.441543579101562,
      "logps/rejected": -18.124588012695312,
      "loss": 0.9663518071174622,
      "memory(GiB)": 46.82,
      "nll_loss": 0.47912853956222534,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.14834752678871155,
      "rewards/margins": 0.7632903456687927,
      "rewards/rejected": -0.6149427890777588,
      "step": 42,
      "train_speed(iter/s)": 0.005356
    },
    {
      "epoch": 0.11165206101914962,
      "grad_norm": 3.8798763751983643,
      "learning_rate": 0.0001999852244286554,
      "logits/chosen": -0.5125827193260193,
      "logits/rejected": -0.5118388533592224,
      "logps/chosen": -8.259347915649414,
      "logps/rejected": -18.246912002563477,
      "loss": 0.8706857562065125,
      "memory(GiB)": 46.82,
      "nll_loss": 0.3688449263572693,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.1189112439751625,
      "rewards/margins": 0.5402826070785522,
      "rewards/rejected": -0.4213714003562927,
      "step": 43,
      "train_speed(iter/s)": 0.005355
    },
    {
      "epoch": 0.11424862057773451,
      "grad_norm": 5.702610015869141,
      "learning_rate": 0.0001999769134895828,
      "logits/chosen": -0.5676945447921753,
      "logits/rejected": -0.5712423324584961,
      "logps/chosen": -7.507511138916016,
      "logps/rejected": -17.306344985961914,
      "loss": 0.9447178840637207,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5068771839141846,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.1572760045528412,
      "rewards/margins": 0.8183934688568115,
      "rewards/rejected": -0.6611174941062927,
      "step": 44,
      "train_speed(iter/s)": 0.005357
    },
    {
      "epoch": 0.11684518013631938,
      "grad_norm": 5.846091270446777,
      "learning_rate": 0.0001999667559878556,
      "logits/chosen": -0.5530126094818115,
      "logits/rejected": -0.5544271469116211,
      "logps/chosen": -9.34422779083252,
      "logps/rejected": -21.99274444580078,
      "loss": 1.0033745765686035,
      "memory(GiB)": 46.82,
      "nll_loss": 0.5510709285736084,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.06781984120607376,
      "rewards/margins": 0.8660807609558105,
      "rewards/rejected": -0.7982609868049622,
      "step": 45,
      "train_speed(iter/s)": 0.005358
    },
    {
      "epoch": 0.11944173969490425,
      "grad_norm": 3.4377248287200928,
      "learning_rate": 0.00019995475211108185,
      "logits/chosen": -0.5516988039016724,
      "logits/rejected": -0.5513719916343689,
      "logps/chosen": -9.321004867553711,
      "logps/rejected": -18.94799041748047,
      "loss": 0.838591992855072,
      "memory(GiB)": 46.82,
      "nll_loss": 0.44976377487182617,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.15304125845432281,
      "rewards/margins": 0.9354310631752014,
      "rewards/rejected": -0.782389760017395,
      "step": 46,
      "train_speed(iter/s)": 0.00536
    },
    {
      "epoch": 0.12203829925348912,
      "grad_norm": 3.021584987640381,
      "learning_rate": 0.00019994090208097176,
      "logits/chosen": -0.5453197956085205,
      "logits/rejected": -0.5457130670547485,
      "logps/chosen": -7.513545036315918,
      "logps/rejected": -19.929990768432617,
      "loss": 0.7878033518791199,
      "memory(GiB)": 46.82,
      "nll_loss": 0.2906043827533722,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.04635176807641983,
      "rewards/margins": 0.8055768609046936,
      "rewards/rejected": -0.759225070476532,
      "step": 47,
      "train_speed(iter/s)": 0.005359
    },
    {
      "epoch": 0.124634858812074,
      "grad_norm": 2.4632484912872314,
      "learning_rate": 0.00019992520615333393,
      "logits/chosen": -0.5288453102111816,
      "logits/rejected": -0.5294773578643799,
      "logps/chosen": -4.316083908081055,
      "logps/rejected": -16.75088119506836,
      "loss": 0.6369743347167969,
      "memory(GiB)": 46.82,
      "nll_loss": 0.19174346327781677,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.1844159960746765,
      "rewards/margins": 0.7728991508483887,
      "rewards/rejected": -0.5884830951690674,
      "step": 48,
      "train_speed(iter/s)": 0.005357
    },
    {
      "epoch": 0.12723141837065888,
      "grad_norm": 2.225041627883911,
      "learning_rate": 0.00019990766461807039,
      "logits/chosen": -0.5786827802658081,
      "logits/rejected": -0.5775803923606873,
      "logps/chosen": -7.1691179275512695,
      "logps/rejected": -19.747949600219727,
      "loss": 0.611931562423706,
      "memory(GiB)": 46.82,
      "nll_loss": 0.26027703285217285,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.32533061504364014,
      "rewards/margins": 1.0796949863433838,
      "rewards/rejected": -0.7543643712997437,
      "step": 49,
      "train_speed(iter/s)": 0.005358
    },
    {
      "epoch": 0.12982797792924375,
      "grad_norm": 3.631110429763794,
      "learning_rate": 0.00019988827779917137,
      "logits/chosen": -0.5347975492477417,
      "logits/rejected": -0.5404946804046631,
      "logps/chosen": -8.115504264831543,
      "logps/rejected": -22.913742065429688,
      "loss": 0.8714032769203186,
      "memory(GiB)": 46.82,
      "nll_loss": 0.4530017375946045,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.22861376404762268,
      "rewards/margins": 0.9870915412902832,
      "rewards/rejected": -0.7584777474403381,
      "step": 50,
      "train_speed(iter/s)": 0.00536
    }
  ],
  "logging_steps": 1,
  "max_steps": 770,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 2,
  "save_steps": 50,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 3.5719756566337946e+17,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}