PEFT
Safetensors
File size: 32,691 Bytes
5aa75ee
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.12373366328976877,
  "eval_steps": 300,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.0024746732657953754,
      "grad_norm": 11.35000991821289,
      "learning_rate": 3.278688524590164e-06,
      "logits/chosen": -0.6587307453155518,
      "logits/rejected": -0.6631469130516052,
      "logps/chosen": -13.55949878692627,
      "logps/rejected": -27.670433044433594,
      "loss": 1.6191432476043701,
      "memory(GiB)": 45.42,
      "nll_loss": 0.9259958863258362,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 1,
      "train_speed(iter/s)": 0.005221
    },
    {
      "epoch": 0.004949346531590751,
      "grad_norm": 9.617626190185547,
      "learning_rate": 6.557377049180328e-06,
      "logits/chosen": -0.6030034422874451,
      "logits/rejected": -0.6114212274551392,
      "logps/chosen": -14.923763275146484,
      "logps/rejected": -29.194869995117188,
      "loss": 1.6753138303756714,
      "memory(GiB)": 45.42,
      "nll_loss": 0.9821667671203613,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 2,
      "train_speed(iter/s)": 0.005275
    },
    {
      "epoch": 0.007424019797386126,
      "grad_norm": 8.504729270935059,
      "learning_rate": 9.836065573770493e-06,
      "logits/chosen": -0.5661746859550476,
      "logits/rejected": -0.5726399421691895,
      "logps/chosen": -13.571891784667969,
      "logps/rejected": -26.323240280151367,
      "loss": 1.6620099544525146,
      "memory(GiB)": 46.09,
      "nll_loss": 0.9678325057029724,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -0.003509162925183773,
      "rewards/margins": -0.001862737350165844,
      "rewards/rejected": -0.0016464253421872854,
      "step": 3,
      "train_speed(iter/s)": 0.005301
    },
    {
      "epoch": 0.009898693063181502,
      "grad_norm": 11.376845359802246,
      "learning_rate": 1.3114754098360657e-05,
      "logits/chosen": -0.6604664921760559,
      "logits/rejected": -0.6652082800865173,
      "logps/chosen": -12.837306022644043,
      "logps/rejected": -23.095237731933594,
      "loss": 1.663628339767456,
      "memory(GiB)": 46.09,
      "nll_loss": 0.975486695766449,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.00841558538377285,
      "rewards/margins": 0.010128158144652843,
      "rewards/rejected": -0.0017125748563557863,
      "step": 4,
      "train_speed(iter/s)": 0.005365
    },
    {
      "epoch": 0.012373366328976877,
      "grad_norm": 5.700821399688721,
      "learning_rate": 1.6393442622950818e-05,
      "logits/chosen": -0.6459366083145142,
      "logits/rejected": -0.6513304710388184,
      "logps/chosen": -18.565486907958984,
      "logps/rejected": -23.259275436401367,
      "loss": 1.594820261001587,
      "memory(GiB)": 46.09,
      "nll_loss": 0.8972694277763367,
      "rewards/accuracies": 0.375,
      "rewards/chosen": 0.00964329019188881,
      "rewards/margins": -0.008526789955794811,
      "rewards/rejected": 0.018170079216361046,
      "step": 5,
      "train_speed(iter/s)": 0.005387
    },
    {
      "epoch": 0.014848039594772253,
      "grad_norm": 8.467960357666016,
      "learning_rate": 1.9672131147540985e-05,
      "logits/chosen": -0.6038874387741089,
      "logits/rejected": -0.6043834090232849,
      "logps/chosen": -13.40754508972168,
      "logps/rejected": -18.13410758972168,
      "loss": 1.6557857990264893,
      "memory(GiB)": 46.09,
      "nll_loss": 0.960586428642273,
      "rewards/accuracies": 0.46875,
      "rewards/chosen": 0.030818985775113106,
      "rewards/margins": -0.003026916179805994,
      "rewards/rejected": 0.03384590521454811,
      "step": 6,
      "train_speed(iter/s)": 0.005393
    },
    {
      "epoch": 0.017322712860567628,
      "grad_norm": 10.094538688659668,
      "learning_rate": 2.295081967213115e-05,
      "logits/chosen": -0.5412906408309937,
      "logits/rejected": -0.5506806969642639,
      "logps/chosen": -12.647178649902344,
      "logps/rejected": -27.220874786376953,
      "loss": 1.5276265144348145,
      "memory(GiB)": 46.09,
      "nll_loss": 0.8624258637428284,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.08376072347164154,
      "rewards/margins": 0.06035517156124115,
      "rewards/rejected": 0.023405561223626137,
      "step": 7,
      "train_speed(iter/s)": 0.005386
    },
    {
      "epoch": 0.019797386126363004,
      "grad_norm": 8.840508460998535,
      "learning_rate": 2.6229508196721314e-05,
      "logits/chosen": -0.6647145748138428,
      "logits/rejected": -0.6669148206710815,
      "logps/chosen": -14.856410026550293,
      "logps/rejected": -21.21141815185547,
      "loss": 1.492944598197937,
      "memory(GiB)": 46.09,
      "nll_loss": 0.844528317451477,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.11737693846225739,
      "rewards/margins": 0.09855899959802628,
      "rewards/rejected": 0.01881793886423111,
      "step": 8,
      "train_speed(iter/s)": 0.005383
    },
    {
      "epoch": 0.02227205939215838,
      "grad_norm": 6.475947380065918,
      "learning_rate": 2.9508196721311478e-05,
      "logits/chosen": -0.6404256224632263,
      "logits/rejected": -0.6432085037231445,
      "logps/chosen": -12.697021484375,
      "logps/rejected": -22.463302612304688,
      "loss": 1.3507211208343506,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6943754553794861,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.18904930353164673,
      "rewards/margins": 0.11120466142892838,
      "rewards/rejected": 0.07784464210271835,
      "step": 9,
      "train_speed(iter/s)": 0.005379
    },
    {
      "epoch": 0.024746732657953754,
      "grad_norm": 3.908445119857788,
      "learning_rate": 3.2786885245901635e-05,
      "logits/chosen": -0.6233164668083191,
      "logits/rejected": -0.6281710863113403,
      "logps/chosen": -12.109004974365234,
      "logps/rejected": -25.513099670410156,
      "loss": 1.1971133947372437,
      "memory(GiB)": 46.09,
      "nll_loss": 0.523026704788208,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": 0.1465698629617691,
      "rewards/margins": 0.09749479591846466,
      "rewards/rejected": 0.04907506704330444,
      "step": 10,
      "train_speed(iter/s)": 0.005374
    },
    {
      "epoch": 0.02722140592374913,
      "grad_norm": 10.216607093811035,
      "learning_rate": 3.6065573770491806e-05,
      "logits/chosen": -0.6259695291519165,
      "logits/rejected": -0.6286618709564209,
      "logps/chosen": -14.0396146774292,
      "logps/rejected": -21.92095947265625,
      "loss": 1.4379217624664307,
      "memory(GiB)": 46.09,
      "nll_loss": 0.7931011915206909,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.10121297836303711,
      "rewards/margins": 0.2612895369529724,
      "rewards/rejected": -0.1600765436887741,
      "step": 11,
      "train_speed(iter/s)": 0.005372
    },
    {
      "epoch": 0.029696079189544505,
      "grad_norm": 6.620578765869141,
      "learning_rate": 3.934426229508197e-05,
      "logits/chosen": -0.6335112452507019,
      "logits/rejected": -0.638087809085846,
      "logps/chosen": -9.480979919433594,
      "logps/rejected": -24.5159912109375,
      "loss": 1.1956348419189453,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5891170501708984,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.07576582580804825,
      "rewards/margins": 0.3991776704788208,
      "rewards/rejected": -0.32341182231903076,
      "step": 12,
      "train_speed(iter/s)": 0.005391
    },
    {
      "epoch": 0.03217075245533988,
      "grad_norm": 6.803226947784424,
      "learning_rate": 4.262295081967213e-05,
      "logits/chosen": -0.6281187534332275,
      "logits/rejected": -0.6315115690231323,
      "logps/chosen": -18.412860870361328,
      "logps/rejected": -27.436920166015625,
      "loss": 1.5400699377059937,
      "memory(GiB)": 46.09,
      "nll_loss": 0.88338702917099,
      "rewards/accuracies": 0.625,
      "rewards/chosen": -0.10771963745355606,
      "rewards/margins": 0.27280330657958984,
      "rewards/rejected": -0.3805229365825653,
      "step": 13,
      "train_speed(iter/s)": 0.005388
    },
    {
      "epoch": 0.034645425721135256,
      "grad_norm": 9.147095680236816,
      "learning_rate": 4.59016393442623e-05,
      "logits/chosen": -0.6376056671142578,
      "logits/rejected": -0.6407235264778137,
      "logps/chosen": -17.056198120117188,
      "logps/rejected": -25.44281768798828,
      "loss": 1.7076380252838135,
      "memory(GiB)": 46.09,
      "nll_loss": 0.973918616771698,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -0.14579348266124725,
      "rewards/margins": 0.050162509083747864,
      "rewards/rejected": -0.19595597684383392,
      "step": 14,
      "train_speed(iter/s)": 0.005397
    },
    {
      "epoch": 0.03712009898693063,
      "grad_norm": 4.252878189086914,
      "learning_rate": 4.918032786885246e-05,
      "logits/chosen": -0.5979167222976685,
      "logits/rejected": -0.6013778448104858,
      "logps/chosen": -12.705180168151855,
      "logps/rejected": -26.116336822509766,
      "loss": 1.3297263383865356,
      "memory(GiB)": 46.09,
      "nll_loss": 0.7305101156234741,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.06688955426216125,
      "rewards/margins": 0.28163066506385803,
      "rewards/rejected": -0.3485202193260193,
      "step": 15,
      "train_speed(iter/s)": 0.005401
    },
    {
      "epoch": 0.03959477225272601,
      "grad_norm": 3.8650903701782227,
      "learning_rate": 5.245901639344263e-05,
      "logits/chosen": -0.5886881351470947,
      "logits/rejected": -0.5908396244049072,
      "logps/chosen": -22.1767578125,
      "logps/rejected": -32.695167541503906,
      "loss": 1.450103521347046,
      "memory(GiB)": 46.09,
      "nll_loss": 0.7899419069290161,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -0.05856169015169144,
      "rewards/margins": 0.17948633432388306,
      "rewards/rejected": -0.2380480319261551,
      "step": 16,
      "train_speed(iter/s)": 0.005395
    },
    {
      "epoch": 0.04206944551852138,
      "grad_norm": 3.568068742752075,
      "learning_rate": 5.5737704918032785e-05,
      "logits/chosen": -0.557040810585022,
      "logits/rejected": -0.5580084919929504,
      "logps/chosen": -17.01874542236328,
      "logps/rejected": -27.190898895263672,
      "loss": 1.4369667768478394,
      "memory(GiB)": 46.09,
      "nll_loss": 0.7801130414009094,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.07399038225412369,
      "rewards/margins": 0.22467321157455444,
      "rewards/rejected": -0.15068282186985016,
      "step": 17,
      "train_speed(iter/s)": 0.005403
    },
    {
      "epoch": 0.04454411878431676,
      "grad_norm": 4.3334150314331055,
      "learning_rate": 5.9016393442622956e-05,
      "logits/chosen": -0.5880481600761414,
      "logits/rejected": -0.5887515544891357,
      "logps/chosen": -21.928936004638672,
      "logps/rejected": -22.768033981323242,
      "loss": 1.6926015615463257,
      "memory(GiB)": 46.09,
      "nll_loss": 0.9716537594795227,
      "rewards/accuracies": 0.5,
      "rewards/chosen": 0.0877460390329361,
      "rewards/margins": 0.0405881404876709,
      "rewards/rejected": 0.047157879918813705,
      "step": 18,
      "train_speed(iter/s)": 0.005402
    },
    {
      "epoch": 0.04701879205011213,
      "grad_norm": 2.5271899700164795,
      "learning_rate": 6.229508196721313e-05,
      "logits/chosen": -0.598438560962677,
      "logits/rejected": -0.604390025138855,
      "logps/chosen": -17.247812271118164,
      "logps/rejected": -31.589086532592773,
      "loss": 1.248651385307312,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6379994750022888,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": 0.2769991457462311,
      "rewards/margins": 0.2692391276359558,
      "rewards/rejected": 0.0077600013464689255,
      "step": 19,
      "train_speed(iter/s)": 0.005406
    },
    {
      "epoch": 0.04949346531590751,
      "grad_norm": 3.571847915649414,
      "learning_rate": 6.557377049180327e-05,
      "logits/chosen": -0.5842810273170471,
      "logits/rejected": -0.5847360491752625,
      "logps/chosen": -15.484521865844727,
      "logps/rejected": -20.548080444335938,
      "loss": 1.5169799327850342,
      "memory(GiB)": 46.09,
      "nll_loss": 0.7671993374824524,
      "rewards/accuracies": 0.40625,
      "rewards/chosen": 0.08881673216819763,
      "rewards/margins": -0.04343637824058533,
      "rewards/rejected": 0.13225311040878296,
      "step": 20,
      "train_speed(iter/s)": 0.00541
    },
    {
      "epoch": 0.051968138581702884,
      "grad_norm": 2.258408546447754,
      "learning_rate": 6.885245901639344e-05,
      "logits/chosen": -0.548245906829834,
      "logits/rejected": -0.551019549369812,
      "logps/chosen": -12.056645393371582,
      "logps/rejected": -22.498403549194336,
      "loss": 1.2092863321304321,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5635381937026978,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.24224215745925903,
      "rewards/margins": 0.19714026153087616,
      "rewards/rejected": 0.045101895928382874,
      "step": 21,
      "train_speed(iter/s)": 0.005423
    },
    {
      "epoch": 0.05444281184749826,
      "grad_norm": 4.153398036956787,
      "learning_rate": 7.213114754098361e-05,
      "logits/chosen": -0.5542203783988953,
      "logits/rejected": -0.5555762052536011,
      "logps/chosen": -10.120831489562988,
      "logps/rejected": -21.4542236328125,
      "loss": 1.2580621242523193,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6088542342185974,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.2806166112422943,
      "rewards/margins": 0.14948059618473053,
      "rewards/rejected": 0.1311360001564026,
      "step": 22,
      "train_speed(iter/s)": 0.005422
    },
    {
      "epoch": 0.056917485113293635,
      "grad_norm": 2.784181833267212,
      "learning_rate": 7.540983606557377e-05,
      "logits/chosen": -0.6017516255378723,
      "logits/rejected": -0.6026712656021118,
      "logps/chosen": -14.456979751586914,
      "logps/rejected": -21.297657012939453,
      "loss": 1.2428232431411743,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5972878932952881,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": 0.27611616253852844,
      "rewards/margins": 0.14373204112052917,
      "rewards/rejected": 0.13238413631916046,
      "step": 23,
      "train_speed(iter/s)": 0.005422
    },
    {
      "epoch": 0.05939215837908901,
      "grad_norm": 2.2945520877838135,
      "learning_rate": 7.868852459016394e-05,
      "logits/chosen": -0.5793949961662292,
      "logits/rejected": -0.5800157785415649,
      "logps/chosen": -9.155426979064941,
      "logps/rejected": -22.067913055419922,
      "loss": 1.1942368745803833,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5604769587516785,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.29127371311187744,
      "rewards/margins": 0.17932376265525818,
      "rewards/rejected": 0.11194998770952225,
      "step": 24,
      "train_speed(iter/s)": 0.005419
    },
    {
      "epoch": 0.061866831644884386,
      "grad_norm": 2.7884368896484375,
      "learning_rate": 8.19672131147541e-05,
      "logits/chosen": -0.5844717621803284,
      "logits/rejected": -0.5868740677833557,
      "logps/chosen": -13.537481307983398,
      "logps/rejected": -17.04685401916504,
      "loss": 1.218743920326233,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6010019779205322,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.38273870944976807,
      "rewards/margins": 0.2067541480064392,
      "rewards/rejected": 0.17598456144332886,
      "step": 25,
      "train_speed(iter/s)": 0.005422
    },
    {
      "epoch": 0.06434150491067976,
      "grad_norm": 2.3340394496917725,
      "learning_rate": 8.524590163934426e-05,
      "logits/chosen": -0.6258128881454468,
      "logits/rejected": -0.6279971599578857,
      "logps/chosen": -9.657672882080078,
      "logps/rejected": -22.88201904296875,
      "loss": 1.114503264427185,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5605608820915222,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.3312107026576996,
      "rewards/margins": 0.372702419757843,
      "rewards/rejected": -0.04149174690246582,
      "step": 26,
      "train_speed(iter/s)": 0.005423
    },
    {
      "epoch": 0.06681617817647514,
      "grad_norm": 3.664553165435791,
      "learning_rate": 8.852459016393443e-05,
      "logits/chosen": -0.5701621770858765,
      "logits/rejected": -0.5702242851257324,
      "logps/chosen": -15.183746337890625,
      "logps/rejected": -17.559988021850586,
      "loss": 1.4017894268035889,
      "memory(GiB)": 46.09,
      "nll_loss": 0.7635535597801208,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.21464091539382935,
      "rewards/margins": 0.1838790327310562,
      "rewards/rejected": 0.03076188825070858,
      "step": 27,
      "train_speed(iter/s)": 0.005417
    },
    {
      "epoch": 0.06929085144227051,
      "grad_norm": 2.2080814838409424,
      "learning_rate": 9.18032786885246e-05,
      "logits/chosen": -0.5039485096931458,
      "logits/rejected": -0.5086482763290405,
      "logps/chosen": -8.541333198547363,
      "logps/rejected": -27.416786193847656,
      "loss": 1.032238483428955,
      "memory(GiB)": 46.09,
      "nll_loss": 0.42585042119026184,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.29641830921173096,
      "rewards/margins": 0.3008955717086792,
      "rewards/rejected": -0.004477284848690033,
      "step": 28,
      "train_speed(iter/s)": 0.005423
    },
    {
      "epoch": 0.0717655247080659,
      "grad_norm": 2.4612784385681152,
      "learning_rate": 9.508196721311476e-05,
      "logits/chosen": -0.5983453989028931,
      "logits/rejected": -0.6011134386062622,
      "logps/chosen": -9.658693313598633,
      "logps/rejected": -25.247703552246094,
      "loss": 1.0381165742874146,
      "memory(GiB)": 46.09,
      "nll_loss": 0.46968621015548706,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": 0.30931776762008667,
      "rewards/margins": 0.36611291766166687,
      "rewards/rejected": -0.05679512768983841,
      "step": 29,
      "train_speed(iter/s)": 0.005423
    },
    {
      "epoch": 0.07424019797386126,
      "grad_norm": 3.299984931945801,
      "learning_rate": 9.836065573770493e-05,
      "logits/chosen": -0.5566404461860657,
      "logits/rejected": -0.5608186721801758,
      "logps/chosen": -11.162762641906738,
      "logps/rejected": -25.61810874938965,
      "loss": 1.2033004760742188,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6197662949562073,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.3209737241268158,
      "rewards/margins": 0.38564494252204895,
      "rewards/rejected": -0.06467118114233017,
      "step": 30,
      "train_speed(iter/s)": 0.005432
    },
    {
      "epoch": 0.07671487123965665,
      "grad_norm": 3.927424430847168,
      "learning_rate": 0.00010163934426229508,
      "logits/chosen": -0.5413897037506104,
      "logits/rejected": -0.5447396636009216,
      "logps/chosen": -7.564568042755127,
      "logps/rejected": -23.63496208190918,
      "loss": 1.1393965482711792,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5696667432785034,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.27428141236305237,
      "rewards/margins": 0.5005658864974976,
      "rewards/rejected": -0.2262844443321228,
      "step": 31,
      "train_speed(iter/s)": 0.005428
    },
    {
      "epoch": 0.07918954450545201,
      "grad_norm": 3.8795111179351807,
      "learning_rate": 0.00010491803278688525,
      "logits/chosen": -0.6150721311569214,
      "logits/rejected": -0.6170963048934937,
      "logps/chosen": -15.14966869354248,
      "logps/rejected": -21.37498664855957,
      "loss": 1.2894086837768555,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6919065713882446,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.2811221778392792,
      "rewards/margins": 0.3919064402580261,
      "rewards/rejected": -0.11078427731990814,
      "step": 32,
      "train_speed(iter/s)": 0.005435
    },
    {
      "epoch": 0.0816642177712474,
      "grad_norm": 3.8578360080718994,
      "learning_rate": 0.00010819672131147543,
      "logits/chosen": -0.6152044534683228,
      "logits/rejected": -0.615663468837738,
      "logps/chosen": -11.967881202697754,
      "logps/rejected": -20.445411682128906,
      "loss": 1.1714155673980713,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5518181324005127,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": 0.21441030502319336,
      "rewards/margins": 0.2466525286436081,
      "rewards/rejected": -0.03224220499396324,
      "step": 33,
      "train_speed(iter/s)": 0.005433
    },
    {
      "epoch": 0.08413889103704277,
      "grad_norm": 3.3592934608459473,
      "learning_rate": 0.00011147540983606557,
      "logits/chosen": -0.6198133826255798,
      "logits/rejected": -0.6197149753570557,
      "logps/chosen": -11.38640308380127,
      "logps/rejected": -22.015522003173828,
      "loss": 1.1110243797302246,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5177969932556152,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.23841583728790283,
      "rewards/margins": 0.32188504934310913,
      "rewards/rejected": -0.0834691971540451,
      "step": 34,
      "train_speed(iter/s)": 0.00543
    },
    {
      "epoch": 0.08661356430283815,
      "grad_norm": 2.9654669761657715,
      "learning_rate": 0.00011475409836065574,
      "logits/chosen": -0.6268936991691589,
      "logits/rejected": -0.6304693818092346,
      "logps/chosen": -8.792684555053711,
      "logps/rejected": -27.867855072021484,
      "loss": 0.9397363662719727,
      "memory(GiB)": 46.09,
      "nll_loss": 0.44072026014328003,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.2782461643218994,
      "rewards/margins": 0.6700869202613831,
      "rewards/rejected": -0.39184072613716125,
      "step": 35,
      "train_speed(iter/s)": 0.00543
    },
    {
      "epoch": 0.08908823756863352,
      "grad_norm": 4.219470977783203,
      "learning_rate": 0.00011803278688524591,
      "logits/chosen": -0.5896088480949402,
      "logits/rejected": -0.5908181667327881,
      "logps/chosen": -9.439773559570312,
      "logps/rejected": -21.788042068481445,
      "loss": 1.1120812892913818,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5399542450904846,
      "rewards/accuracies": 0.625,
      "rewards/chosen": 0.19946175813674927,
      "rewards/margins": 0.4053455591201782,
      "rewards/rejected": -0.20588380098342896,
      "step": 36,
      "train_speed(iter/s)": 0.005431
    },
    {
      "epoch": 0.0915629108344289,
      "grad_norm": 4.5739665031433105,
      "learning_rate": 0.00012131147540983607,
      "logits/chosen": -0.6280671954154968,
      "logits/rejected": -0.6325269937515259,
      "logps/chosen": -8.791489601135254,
      "logps/rejected": -30.336650848388672,
      "loss": 1.1410616636276245,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6490904688835144,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.2655602991580963,
      "rewards/margins": 0.6452851891517639,
      "rewards/rejected": -0.3797248899936676,
      "step": 37,
      "train_speed(iter/s)": 0.005434
    },
    {
      "epoch": 0.09403758410022427,
      "grad_norm": 3.020256280899048,
      "learning_rate": 0.00012459016393442625,
      "logits/chosen": -0.6382966637611389,
      "logits/rejected": -0.6446542143821716,
      "logps/chosen": -12.288652420043945,
      "logps/rejected": -31.03972625732422,
      "loss": 0.9547407031059265,
      "memory(GiB)": 46.09,
      "nll_loss": 0.574475109577179,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.3463619351387024,
      "rewards/margins": 1.0072863101959229,
      "rewards/rejected": -0.6609243154525757,
      "step": 38,
      "train_speed(iter/s)": 0.005438
    },
    {
      "epoch": 0.09651225736601965,
      "grad_norm": 3.258894205093384,
      "learning_rate": 0.0001278688524590164,
      "logits/chosen": -0.6787834763526917,
      "logits/rejected": -0.6786651015281677,
      "logps/chosen": -12.136661529541016,
      "logps/rejected": -20.544681549072266,
      "loss": 1.0752589702606201,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6294119358062744,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.34082022309303284,
      "rewards/margins": 0.8202961683273315,
      "rewards/rejected": -0.4794759452342987,
      "step": 39,
      "train_speed(iter/s)": 0.005436
    },
    {
      "epoch": 0.09898693063181502,
      "grad_norm": 3.8263096809387207,
      "learning_rate": 0.00013114754098360654,
      "logits/chosen": -0.6569682359695435,
      "logits/rejected": -0.6592159271240234,
      "logps/chosen": -21.227203369140625,
      "logps/rejected": -24.57542610168457,
      "loss": 1.3819258213043213,
      "memory(GiB)": 46.09,
      "nll_loss": 0.8235953450202942,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.12423999607563019,
      "rewards/margins": 0.5565845966339111,
      "rewards/rejected": -0.43234458565711975,
      "step": 40,
      "train_speed(iter/s)": 0.005435
    },
    {
      "epoch": 0.1014616038976104,
      "grad_norm": 3.6862781047821045,
      "learning_rate": 0.00013442622950819673,
      "logits/chosen": -0.6126083135604858,
      "logits/rejected": -0.618023157119751,
      "logps/chosen": -18.38534927368164,
      "logps/rejected": -31.6680850982666,
      "loss": 1.0961635112762451,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6294427514076233,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": 0.16896528005599976,
      "rewards/margins": 0.7662918567657471,
      "rewards/rejected": -0.5973266363143921,
      "step": 41,
      "train_speed(iter/s)": 0.005439
    },
    {
      "epoch": 0.10393627716340577,
      "grad_norm": 2.924959897994995,
      "learning_rate": 0.00013770491803278688,
      "logits/chosen": -0.6756088137626648,
      "logits/rejected": -0.6791292428970337,
      "logps/chosen": -12.787935256958008,
      "logps/rejected": -35.33570861816406,
      "loss": 0.9558172821998596,
      "memory(GiB)": 46.09,
      "nll_loss": 0.45665955543518066,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.14984729886054993,
      "rewards/margins": 0.7973157167434692,
      "rewards/rejected": -0.6474683880805969,
      "step": 42,
      "train_speed(iter/s)": 0.005438
    },
    {
      "epoch": 0.10641095042920115,
      "grad_norm": 5.650424480438232,
      "learning_rate": 0.00014098360655737707,
      "logits/chosen": -0.6601684093475342,
      "logits/rejected": -0.667102038860321,
      "logps/chosen": -12.86988639831543,
      "logps/rejected": -33.79030227661133,
      "loss": 0.97264564037323,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5231238603591919,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.10155264288187027,
      "rewards/margins": 0.8151469230651855,
      "rewards/rejected": -0.7135943174362183,
      "step": 43,
      "train_speed(iter/s)": 0.005438
    },
    {
      "epoch": 0.10888562369499652,
      "grad_norm": 4.125715732574463,
      "learning_rate": 0.00014426229508196722,
      "logits/chosen": -0.615486741065979,
      "logits/rejected": -0.6166262030601501,
      "logps/chosen": -22.158443450927734,
      "logps/rejected": -30.26171112060547,
      "loss": 1.174919843673706,
      "memory(GiB)": 46.09,
      "nll_loss": 0.67107754945755,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.12467168271541595,
      "rewards/margins": 1.025106430053711,
      "rewards/rejected": -0.9004346132278442,
      "step": 44,
      "train_speed(iter/s)": 0.005437
    },
    {
      "epoch": 0.1113602969607919,
      "grad_norm": 4.247290134429932,
      "learning_rate": 0.00014754098360655738,
      "logits/chosen": -0.6652258634567261,
      "logits/rejected": -0.672545313835144,
      "logps/chosen": -9.705460548400879,
      "logps/rejected": -31.59243392944336,
      "loss": 0.9555923342704773,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5207614302635193,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.2395530790090561,
      "rewards/margins": 1.0814993381500244,
      "rewards/rejected": -0.8419461846351624,
      "step": 45,
      "train_speed(iter/s)": 0.005438
    },
    {
      "epoch": 0.11383497022658727,
      "grad_norm": 3.2860352993011475,
      "learning_rate": 0.00015081967213114754,
      "logits/chosen": -0.614319920539856,
      "logits/rejected": -0.619287371635437,
      "logps/chosen": -13.63390064239502,
      "logps/rejected": -35.74215316772461,
      "loss": 0.9872268438339233,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6003797650337219,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.28653809428215027,
      "rewards/margins": 1.200305461883545,
      "rewards/rejected": -0.9137674570083618,
      "step": 46,
      "train_speed(iter/s)": 0.005439
    },
    {
      "epoch": 0.11630964349238265,
      "grad_norm": 5.599460601806641,
      "learning_rate": 0.0001540983606557377,
      "logits/chosen": -0.6212424039840698,
      "logits/rejected": -0.6217514276504517,
      "logps/chosen": -17.058250427246094,
      "logps/rejected": -29.002065658569336,
      "loss": 1.1983596086502075,
      "memory(GiB)": 46.09,
      "nll_loss": 0.7794193029403687,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.22204741835594177,
      "rewards/margins": 0.9237122535705566,
      "rewards/rejected": -0.7016648054122925,
      "step": 47,
      "train_speed(iter/s)": 0.005439
    },
    {
      "epoch": 0.11878431675817802,
      "grad_norm": 4.221462726593018,
      "learning_rate": 0.00015737704918032788,
      "logits/chosen": -0.6427355408668518,
      "logits/rejected": -0.6452814936637878,
      "logps/chosen": -13.284379005432129,
      "logps/rejected": -28.47121238708496,
      "loss": 0.9505041241645813,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5451131463050842,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": 0.22931885719299316,
      "rewards/margins": 0.9360889792442322,
      "rewards/rejected": -0.706770122051239,
      "step": 48,
      "train_speed(iter/s)": 0.005439
    },
    {
      "epoch": 0.1212589900239734,
      "grad_norm": 4.555298328399658,
      "learning_rate": 0.00016065573770491804,
      "logits/chosen": -0.6409769058227539,
      "logits/rejected": -0.6388667225837708,
      "logps/chosen": -12.98600959777832,
      "logps/rejected": -19.881681442260742,
      "loss": 1.2290067672729492,
      "memory(GiB)": 46.09,
      "nll_loss": 0.5956090688705444,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": 0.07330272346735,
      "rewards/margins": 0.5512866973876953,
      "rewards/rejected": -0.47798389196395874,
      "step": 49,
      "train_speed(iter/s)": 0.00544
    },
    {
      "epoch": 0.12373366328976877,
      "grad_norm": 3.2366769313812256,
      "learning_rate": 0.0001639344262295082,
      "logits/chosen": -0.6371148228645325,
      "logits/rejected": -0.6468245983123779,
      "logps/chosen": -20.83090591430664,
      "logps/rejected": -45.217796325683594,
      "loss": 0.996230959892273,
      "memory(GiB)": 46.09,
      "nll_loss": 0.6383583545684814,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.13887403905391693,
      "rewards/margins": 1.3918437957763672,
      "rewards/rejected": -1.252969741821289,
      "step": 50,
      "train_speed(iter/s)": 0.005439
    }
  ],
  "logging_steps": 1,
  "max_steps": 1212,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 3,
  "save_steps": 50,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 3.492565635857121e+17,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}