PEFT
Safetensors
File size: 32,545 Bytes
bd05757
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.12574662055957248,
  "eval_steps": 300,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.002514932411191449,
      "grad_norm": 5.559185028076172,
      "learning_rate": 3.3333333333333333e-06,
      "logits/chosen": -0.5158984065055847,
      "logits/rejected": -0.6433685421943665,
      "logps/chosen": -8.879493713378906,
      "logps/rejected": -18.298219680786133,
      "loss": 1.2430726289749146,
      "memory(GiB)": 30.69,
      "nll_loss": 0.5499253869056702,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 1,
      "train_speed(iter/s)": 0.010477
    },
    {
      "epoch": 0.005029864822382898,
      "grad_norm": 5.400235176086426,
      "learning_rate": 6.666666666666667e-06,
      "logits/chosen": -0.5219721794128418,
      "logits/rejected": -0.6263731718063354,
      "logps/chosen": -4.77984094619751,
      "logps/rejected": -15.150838851928711,
      "loss": 1.0675525665283203,
      "memory(GiB)": 33.9,
      "nll_loss": 0.3744054436683655,
      "rewards/accuracies": 0.0,
      "rewards/chosen": 0.0,
      "rewards/margins": 0.0,
      "rewards/rejected": 0.0,
      "step": 2,
      "train_speed(iter/s)": 0.010866
    },
    {
      "epoch": 0.007544797233574348,
      "grad_norm": 7.852550983428955,
      "learning_rate": 1e-05,
      "logits/chosen": -0.48881009221076965,
      "logits/rejected": -0.6540625691413879,
      "logps/chosen": -4.714770793914795,
      "logps/rejected": -17.99374008178711,
      "loss": 1.0851404666900635,
      "memory(GiB)": 33.9,
      "nll_loss": 0.3894187808036804,
      "rewards/accuracies": 0.375,
      "rewards/chosen": -0.002094469266012311,
      "rewards/margins": -0.004971538204699755,
      "rewards/rejected": 0.0028770684730261564,
      "step": 3,
      "train_speed(iter/s)": 0.011002
    },
    {
      "epoch": 0.010059729644765796,
      "grad_norm": 10.150762557983398,
      "learning_rate": 1.3333333333333333e-05,
      "logits/chosen": -0.4506370425224304,
      "logits/rejected": -0.6422093510627747,
      "logps/chosen": -3.6849846839904785,
      "logps/rejected": -21.201997756958008,
      "loss": 1.092491865158081,
      "memory(GiB)": 37.36,
      "nll_loss": 0.4020901322364807,
      "rewards/accuracies": 0.5,
      "rewards/chosen": 0.007022961974143982,
      "rewards/margins": 0.0057290042750537395,
      "rewards/rejected": 0.001293957349844277,
      "step": 4,
      "train_speed(iter/s)": 0.011051
    },
    {
      "epoch": 0.012574662055957246,
      "grad_norm": 6.588510036468506,
      "learning_rate": 1.6666666666666667e-05,
      "logits/chosen": -0.4159216284751892,
      "logits/rejected": -0.5884239673614502,
      "logps/chosen": -8.611150741577148,
      "logps/rejected": -19.931533813476562,
      "loss": 1.1986628770828247,
      "memory(GiB)": 37.36,
      "nll_loss": 0.5155895948410034,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.005048489198088646,
      "rewards/margins": 0.020845137536525726,
      "rewards/rejected": -0.01579664833843708,
      "step": 5,
      "train_speed(iter/s)": 0.011086
    },
    {
      "epoch": 0.015089594467148696,
      "grad_norm": 3.965754508972168,
      "learning_rate": 2e-05,
      "logits/chosen": -0.47118157148361206,
      "logits/rejected": -0.5790206789970398,
      "logps/chosen": -9.572708129882812,
      "logps/rejected": -19.066829681396484,
      "loss": 1.1965497732162476,
      "memory(GiB)": 37.36,
      "nll_loss": 0.5279884338378906,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.006116065196692944,
      "rewards/margins": 0.05174415558576584,
      "rewards/rejected": -0.04562808945775032,
      "step": 6,
      "train_speed(iter/s)": 0.01111
    },
    {
      "epoch": 0.017604526878340146,
      "grad_norm": 2.719625234603882,
      "learning_rate": 2.3333333333333336e-05,
      "logits/chosen": -0.40740644931793213,
      "logits/rejected": -0.5419386029243469,
      "logps/chosen": -9.413152694702148,
      "logps/rejected": -24.703401565551758,
      "loss": 1.1549676656723022,
      "memory(GiB)": 40.85,
      "nll_loss": 0.5149396061897278,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": -0.02250390499830246,
      "rewards/margins": 0.12123934924602509,
      "rewards/rejected": -0.14374326169490814,
      "step": 7,
      "train_speed(iter/s)": 0.011114
    },
    {
      "epoch": 0.020119459289531592,
      "grad_norm": 3.325852394104004,
      "learning_rate": 2.6666666666666667e-05,
      "logits/chosen": -0.4091758728027344,
      "logits/rejected": -0.5692812204360962,
      "logps/chosen": -5.904629230499268,
      "logps/rejected": -20.752662658691406,
      "loss": 1.0213468074798584,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3945533037185669,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.041384391486644745,
      "rewards/margins": 0.17802417278289795,
      "rewards/rejected": -0.2194085717201233,
      "step": 8,
      "train_speed(iter/s)": 0.011127
    },
    {
      "epoch": 0.022634391700723042,
      "grad_norm": 3.5531411170959473,
      "learning_rate": 3e-05,
      "logits/chosen": -0.3281947374343872,
      "logits/rejected": -0.5156837701797485,
      "logps/chosen": -5.975313186645508,
      "logps/rejected": -27.066158294677734,
      "loss": 0.8695712089538574,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3611774742603302,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.0457351878285408,
      "rewards/margins": 0.4895857870578766,
      "rewards/rejected": -0.443850576877594,
      "step": 9,
      "train_speed(iter/s)": 0.011136
    },
    {
      "epoch": 0.025149324111914492,
      "grad_norm": 4.356088161468506,
      "learning_rate": 3.3333333333333335e-05,
      "logits/chosen": -0.43971675634384155,
      "logits/rejected": -0.5702978372573853,
      "logps/chosen": -6.376318454742432,
      "logps/rejected": -19.42030143737793,
      "loss": 1.0046417713165283,
      "memory(GiB)": 40.85,
      "nll_loss": 0.42133060097694397,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.17984721064567566,
      "rewards/margins": 0.43266722559928894,
      "rewards/rejected": -0.6125144362449646,
      "step": 10,
      "train_speed(iter/s)": 0.01115
    },
    {
      "epoch": 0.027664256523105942,
      "grad_norm": 3.9732213020324707,
      "learning_rate": 3.6666666666666666e-05,
      "logits/chosen": -0.4561832845211029,
      "logits/rejected": -0.6065505146980286,
      "logps/chosen": -6.498957633972168,
      "logps/rejected": -27.428552627563477,
      "loss": 0.9565106630325317,
      "memory(GiB)": 40.85,
      "nll_loss": 0.40273764729499817,
      "rewards/accuracies": 0.75,
      "rewards/chosen": -0.12391924858093262,
      "rewards/margins": 0.5706068277359009,
      "rewards/rejected": -0.6945260763168335,
      "step": 11,
      "train_speed(iter/s)": 0.011161
    },
    {
      "epoch": 0.030179188934297392,
      "grad_norm": 2.2540578842163086,
      "learning_rate": 4e-05,
      "logits/chosen": -0.42088037729263306,
      "logits/rejected": -0.6009025573730469,
      "logps/chosen": -4.243446350097656,
      "logps/rejected": -26.567686080932617,
      "loss": 0.7599425911903381,
      "memory(GiB)": 40.85,
      "nll_loss": 0.28007903695106506,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": -0.14110325276851654,
      "rewards/margins": 0.6590132713317871,
      "rewards/rejected": -0.8001165390014648,
      "step": 12,
      "train_speed(iter/s)": 0.011171
    },
    {
      "epoch": 0.03269412134548884,
      "grad_norm": 6.460833549499512,
      "learning_rate": 4.3333333333333334e-05,
      "logits/chosen": -0.4136754274368286,
      "logits/rejected": -0.5452494621276855,
      "logps/chosen": -7.585506439208984,
      "logps/rejected": -21.19340705871582,
      "loss": 1.223608136177063,
      "memory(GiB)": 40.85,
      "nll_loss": 0.6720148921012878,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": -0.25483113527297974,
      "rewards/margins": 0.49035438895225525,
      "rewards/rejected": -0.7451854944229126,
      "step": 13,
      "train_speed(iter/s)": 0.011181
    },
    {
      "epoch": 0.03520905375668029,
      "grad_norm": 4.092947006225586,
      "learning_rate": 4.666666666666667e-05,
      "logits/chosen": -0.527854323387146,
      "logits/rejected": -0.5994939804077148,
      "logps/chosen": -8.185604095458984,
      "logps/rejected": -17.946279525756836,
      "loss": 1.2557107210159302,
      "memory(GiB)": 40.85,
      "nll_loss": 0.66472989320755,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -0.145107239484787,
      "rewards/margins": 0.41058170795440674,
      "rewards/rejected": -0.5556889772415161,
      "step": 14,
      "train_speed(iter/s)": 0.011194
    },
    {
      "epoch": 0.03772398616787174,
      "grad_norm": 3.926342248916626,
      "learning_rate": 5e-05,
      "logits/chosen": -0.407508909702301,
      "logits/rejected": -0.5949459075927734,
      "logps/chosen": -3.4148104190826416,
      "logps/rejected": -22.69104766845703,
      "loss": 0.8548452258110046,
      "memory(GiB)": 40.85,
      "nll_loss": 0.40506720542907715,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": -0.025914989411830902,
      "rewards/margins": 0.6952927708625793,
      "rewards/rejected": -0.7212077379226685,
      "step": 15,
      "train_speed(iter/s)": 0.0112
    },
    {
      "epoch": 0.040238918579063185,
      "grad_norm": 2.4273853302001953,
      "learning_rate": 5.333333333333333e-05,
      "logits/chosen": -0.3462049961090088,
      "logits/rejected": -0.58342045545578,
      "logps/chosen": -3.8651039600372314,
      "logps/rejected": -28.470134735107422,
      "loss": 0.821665346622467,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3309793472290039,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.04178892821073532,
      "rewards/margins": 0.5164157152175903,
      "rewards/rejected": -0.4746267795562744,
      "step": 16,
      "train_speed(iter/s)": 0.011202
    },
    {
      "epoch": 0.04275385099025464,
      "grad_norm": 1.8921568393707275,
      "learning_rate": 5.666666666666667e-05,
      "logits/chosen": -0.5054872632026672,
      "logits/rejected": -0.6153637170791626,
      "logps/chosen": -1.8910857439041138,
      "logps/rejected": -16.781475067138672,
      "loss": 0.7665270566940308,
      "memory(GiB)": 40.85,
      "nll_loss": 0.2412014603614807,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.04062865674495697,
      "rewards/margins": 0.41468262672424316,
      "rewards/rejected": -0.3740540146827698,
      "step": 17,
      "train_speed(iter/s)": 0.011212
    },
    {
      "epoch": 0.045268783401446085,
      "grad_norm": 3.2724339962005615,
      "learning_rate": 6e-05,
      "logits/chosen": -0.45994284749031067,
      "logits/rejected": -0.5327339768409729,
      "logps/chosen": -8.705971717834473,
      "logps/rejected": -17.33376121520996,
      "loss": 1.2050995826721191,
      "memory(GiB)": 40.85,
      "nll_loss": 0.5643416047096252,
      "rewards/accuracies": 0.625,
      "rewards/chosen": -0.048418305814266205,
      "rewards/margins": 0.16582812368869781,
      "rewards/rejected": -0.21424642205238342,
      "step": 18,
      "train_speed(iter/s)": 0.011215
    },
    {
      "epoch": 0.04778371581263754,
      "grad_norm": 2.6650567054748535,
      "learning_rate": 6.333333333333333e-05,
      "logits/chosen": -0.48406994342803955,
      "logits/rejected": -0.5535129308700562,
      "logps/chosen": -10.087296485900879,
      "logps/rejected": -17.584102630615234,
      "loss": 1.1602699756622314,
      "memory(GiB)": 40.85,
      "nll_loss": 0.5509804487228394,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -0.005405411124229431,
      "rewards/margins": 0.23162491619586945,
      "rewards/rejected": -0.23703034222126007,
      "step": 19,
      "train_speed(iter/s)": 0.01122
    },
    {
      "epoch": 0.050298648223828984,
      "grad_norm": 2.393120527267456,
      "learning_rate": 6.666666666666667e-05,
      "logits/chosen": -0.4699333906173706,
      "logits/rejected": -0.5745525360107422,
      "logps/chosen": -5.482749938964844,
      "logps/rejected": -15.294036865234375,
      "loss": 1.0463979244232178,
      "memory(GiB)": 40.85,
      "nll_loss": 0.40886539220809937,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.030414806678891182,
      "rewards/margins": 0.18470264971256256,
      "rewards/rejected": -0.15428784489631653,
      "step": 20,
      "train_speed(iter/s)": 0.011224
    },
    {
      "epoch": 0.05281358063502043,
      "grad_norm": 1.7328065633773804,
      "learning_rate": 7e-05,
      "logits/chosen": -0.5130109190940857,
      "logits/rejected": -0.6171243190765381,
      "logps/chosen": -8.619268417358398,
      "logps/rejected": -18.43971824645996,
      "loss": 1.1801689863204956,
      "memory(GiB)": 40.85,
      "nll_loss": 0.6120539903640747,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.07324957102537155,
      "rewards/margins": 0.3033149242401123,
      "rewards/rejected": -0.23006536066532135,
      "step": 21,
      "train_speed(iter/s)": 0.011228
    },
    {
      "epoch": 0.055328513046211884,
      "grad_norm": 2.848578691482544,
      "learning_rate": 7.333333333333333e-05,
      "logits/chosen": -0.46683233976364136,
      "logits/rejected": -0.5329924821853638,
      "logps/chosen": -4.357663154602051,
      "logps/rejected": -15.35399055480957,
      "loss": 0.9406945705413818,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3216635584831238,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -0.010179778560996056,
      "rewards/margins": 0.2008945494890213,
      "rewards/rejected": -0.21107429265975952,
      "step": 22,
      "train_speed(iter/s)": 0.011229
    },
    {
      "epoch": 0.05784344545740333,
      "grad_norm": 1.7426271438598633,
      "learning_rate": 7.666666666666667e-05,
      "logits/chosen": -0.5002316236495972,
      "logits/rejected": -0.5488481521606445,
      "logps/chosen": -5.690494537353516,
      "logps/rejected": -15.590461730957031,
      "loss": 0.9775924682617188,
      "memory(GiB)": 40.85,
      "nll_loss": 0.355554461479187,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.009325886145234108,
      "rewards/margins": 0.18430516123771667,
      "rewards/rejected": -0.1749793142080307,
      "step": 23,
      "train_speed(iter/s)": 0.011234
    },
    {
      "epoch": 0.060358377868594784,
      "grad_norm": 1.8518409729003906,
      "learning_rate": 8e-05,
      "logits/chosen": -0.5258264541625977,
      "logits/rejected": -0.5805689096450806,
      "logps/chosen": -9.133979797363281,
      "logps/rejected": -17.886051177978516,
      "loss": 1.1810051202774048,
      "memory(GiB)": 40.85,
      "nll_loss": 0.6029603481292725,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.04269062727689743,
      "rewards/margins": 0.2787190079689026,
      "rewards/rejected": -0.23602835834026337,
      "step": 24,
      "train_speed(iter/s)": 0.011237
    },
    {
      "epoch": 0.06287331027978624,
      "grad_norm": 2.4842066764831543,
      "learning_rate": 8.333333333333334e-05,
      "logits/chosen": -0.44220152497291565,
      "logits/rejected": -0.5788168907165527,
      "logps/chosen": -4.989194869995117,
      "logps/rejected": -18.047056198120117,
      "loss": 1.0011777877807617,
      "memory(GiB)": 40.85,
      "nll_loss": 0.4066605269908905,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.021916719153523445,
      "rewards/margins": 0.2587287425994873,
      "rewards/rejected": -0.236812025308609,
      "step": 25,
      "train_speed(iter/s)": 0.011239
    },
    {
      "epoch": 0.06538824269097768,
      "grad_norm": 1.766322135925293,
      "learning_rate": 8.666666666666667e-05,
      "logits/chosen": -0.3389984369277954,
      "logits/rejected": -0.543292224407196,
      "logps/chosen": -11.735610961914062,
      "logps/rejected": -26.25033950805664,
      "loss": 1.0063844919204712,
      "memory(GiB)": 40.85,
      "nll_loss": 0.5172990560531616,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.07315510511398315,
      "rewards/margins": 0.5734083652496338,
      "rewards/rejected": -0.5002533197402954,
      "step": 26,
      "train_speed(iter/s)": 0.011238
    },
    {
      "epoch": 0.06790317510216913,
      "grad_norm": 3.3314130306243896,
      "learning_rate": 9e-05,
      "logits/chosen": -0.37741950154304504,
      "logits/rejected": -0.5884826183319092,
      "logps/chosen": -5.442512035369873,
      "logps/rejected": -27.738323211669922,
      "loss": 0.8821365237236023,
      "memory(GiB)": 40.85,
      "nll_loss": 0.4055330753326416,
      "rewards/accuracies": 0.875,
      "rewards/chosen": -0.03083166666328907,
      "rewards/margins": 0.6056570410728455,
      "rewards/rejected": -0.6364887952804565,
      "step": 27,
      "train_speed(iter/s)": 0.011238
    },
    {
      "epoch": 0.07041810751336058,
      "grad_norm": 2.849647283554077,
      "learning_rate": 9.333333333333334e-05,
      "logits/chosen": -0.4310716688632965,
      "logits/rejected": -0.5529810190200806,
      "logps/chosen": -8.224971771240234,
      "logps/rejected": -26.79846954345703,
      "loss": 0.8747767806053162,
      "memory(GiB)": 40.85,
      "nll_loss": 0.45313140749931335,
      "rewards/accuracies": 0.875,
      "rewards/chosen": -0.07478700578212738,
      "rewards/margins": 0.8052245378494263,
      "rewards/rejected": -0.8800115585327148,
      "step": 28,
      "train_speed(iter/s)": 0.011238
    },
    {
      "epoch": 0.07293303992455202,
      "grad_norm": 2.247368097305298,
      "learning_rate": 9.666666666666667e-05,
      "logits/chosen": -0.37296879291534424,
      "logits/rejected": -0.5259015560150146,
      "logps/chosen": -6.546780109405518,
      "logps/rejected": -25.603477478027344,
      "loss": 0.9804578423500061,
      "memory(GiB)": 40.85,
      "nll_loss": 0.4873877465724945,
      "rewards/accuracies": 0.75,
      "rewards/chosen": -0.046319298446178436,
      "rewards/margins": 0.5485984086990356,
      "rewards/rejected": -0.5949177145957947,
      "step": 29,
      "train_speed(iter/s)": 0.011239
    },
    {
      "epoch": 0.07544797233574348,
      "grad_norm": 1.7451585531234741,
      "learning_rate": 0.0001,
      "logits/chosen": -0.36992424726486206,
      "logits/rejected": -0.45540890097618103,
      "logps/chosen": -6.483048439025879,
      "logps/rejected": -18.744525909423828,
      "loss": 0.9453181624412537,
      "memory(GiB)": 40.85,
      "nll_loss": 0.37866073846817017,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.0520947091281414,
      "rewards/margins": 0.33587026596069336,
      "rewards/rejected": -0.28377556800842285,
      "step": 30,
      "train_speed(iter/s)": 0.01124
    },
    {
      "epoch": 0.07796290474693493,
      "grad_norm": 2.8843863010406494,
      "learning_rate": 0.00010333333333333334,
      "logits/chosen": -0.3973531723022461,
      "logits/rejected": -0.4880366325378418,
      "logps/chosen": -6.5046491622924805,
      "logps/rejected": -18.793209075927734,
      "loss": 1.0352380275726318,
      "memory(GiB)": 40.85,
      "nll_loss": 0.514582097530365,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": 0.06333249807357788,
      "rewards/margins": 0.5268359780311584,
      "rewards/rejected": -0.4635034203529358,
      "step": 31,
      "train_speed(iter/s)": 0.011242
    },
    {
      "epoch": 0.08047783715812637,
      "grad_norm": 1.9934616088867188,
      "learning_rate": 0.00010666666666666667,
      "logits/chosen": -0.38435813784599304,
      "logits/rejected": -0.4866703450679779,
      "logps/chosen": -5.984093189239502,
      "logps/rejected": -28.37721061706543,
      "loss": 0.9228850603103638,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3919341564178467,
      "rewards/accuracies": 0.75,
      "rewards/chosen": 0.08762034773826599,
      "rewards/margins": 0.4990919232368469,
      "rewards/rejected": -0.41147157549858093,
      "step": 32,
      "train_speed(iter/s)": 0.011242
    },
    {
      "epoch": 0.08299276956931782,
      "grad_norm": 2.605156421661377,
      "learning_rate": 0.00011000000000000002,
      "logits/chosen": -0.3683161437511444,
      "logits/rejected": -0.4800977110862732,
      "logps/chosen": -6.79887056350708,
      "logps/rejected": -18.521530151367188,
      "loss": 0.9287618398666382,
      "memory(GiB)": 40.85,
      "nll_loss": 0.4155515730381012,
      "rewards/accuracies": 0.875,
      "rewards/chosen": 0.062238909304142,
      "rewards/margins": 0.4814634323120117,
      "rewards/rejected": -0.41922450065612793,
      "step": 33,
      "train_speed(iter/s)": 0.011243
    },
    {
      "epoch": 0.08550770198050928,
      "grad_norm": 2.1593198776245117,
      "learning_rate": 0.00011333333333333334,
      "logits/chosen": -0.3462904989719391,
      "logits/rejected": -0.4482634663581848,
      "logps/chosen": -4.484028339385986,
      "logps/rejected": -22.155223846435547,
      "loss": 0.8287199139595032,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3564324378967285,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": -0.011370105668902397,
      "rewards/margins": 0.8015316724777222,
      "rewards/rejected": -0.8129018545150757,
      "step": 34,
      "train_speed(iter/s)": 0.011244
    },
    {
      "epoch": 0.08802263439170073,
      "grad_norm": 2.1223862171173096,
      "learning_rate": 0.00011666666666666668,
      "logits/chosen": -0.23746490478515625,
      "logits/rejected": -0.4123544991016388,
      "logps/chosen": -4.062009334564209,
      "logps/rejected": -30.214771270751953,
      "loss": 0.8381334543228149,
      "memory(GiB)": 40.85,
      "nll_loss": 0.45768678188323975,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.06588438153266907,
      "rewards/margins": 1.1650195121765137,
      "rewards/rejected": -1.0991352796554565,
      "step": 35,
      "train_speed(iter/s)": 0.011244
    },
    {
      "epoch": 0.09053756680289217,
      "grad_norm": 1.7519793510437012,
      "learning_rate": 0.00012,
      "logits/chosen": -0.274143248796463,
      "logits/rejected": -0.4072067439556122,
      "logps/chosen": -7.12678861618042,
      "logps/rejected": -29.586929321289062,
      "loss": 0.7818687558174133,
      "memory(GiB)": 40.85,
      "nll_loss": 0.38336753845214844,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.030900314450263977,
      "rewards/margins": 1.0601840019226074,
      "rewards/rejected": -1.0292836427688599,
      "step": 36,
      "train_speed(iter/s)": 0.011244
    },
    {
      "epoch": 0.09305249921408362,
      "grad_norm": 2.2621781826019287,
      "learning_rate": 0.00012333333333333334,
      "logits/chosen": -0.30612003803253174,
      "logits/rejected": -0.44930776953697205,
      "logps/chosen": -5.637537956237793,
      "logps/rejected": -30.86564064025879,
      "loss": 0.7518173456192017,
      "memory(GiB)": 40.85,
      "nll_loss": 0.4073091149330139,
      "rewards/accuracies": 0.875,
      "rewards/chosen": -0.1094760149717331,
      "rewards/margins": 1.2509604692459106,
      "rewards/rejected": -1.3604364395141602,
      "step": 37,
      "train_speed(iter/s)": 0.011245
    },
    {
      "epoch": 0.09556743162527508,
      "grad_norm": 2.6005046367645264,
      "learning_rate": 0.00012666666666666666,
      "logits/chosen": -0.36841830611228943,
      "logits/rejected": -0.44501256942749023,
      "logps/chosen": -8.786764144897461,
      "logps/rejected": -21.693777084350586,
      "loss": 0.967311441898346,
      "memory(GiB)": 40.85,
      "nll_loss": 0.5350124835968018,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": -0.05166015028953552,
      "rewards/margins": 0.9184513092041016,
      "rewards/rejected": -0.9701113700866699,
      "step": 38,
      "train_speed(iter/s)": 0.011247
    },
    {
      "epoch": 0.09808236403646652,
      "grad_norm": 7.679723262786865,
      "learning_rate": 0.00013000000000000002,
      "logits/chosen": -0.3933795094490051,
      "logits/rejected": -0.4303474426269531,
      "logps/chosen": -9.630545616149902,
      "logps/rejected": -25.0108642578125,
      "loss": 1.1940371990203857,
      "memory(GiB)": 40.85,
      "nll_loss": 0.6422770023345947,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -0.19723013043403625,
      "rewards/margins": 0.8150386214256287,
      "rewards/rejected": -1.0122687816619873,
      "step": 39,
      "train_speed(iter/s)": 0.011247
    },
    {
      "epoch": 0.10059729644765797,
      "grad_norm": 2.497746229171753,
      "learning_rate": 0.00013333333333333334,
      "logits/chosen": -0.3561173677444458,
      "logits/rejected": -0.4964173436164856,
      "logps/chosen": -6.288295269012451,
      "logps/rejected": -28.722339630126953,
      "loss": 0.7734813690185547,
      "memory(GiB)": 40.85,
      "nll_loss": 0.35979557037353516,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.020053118467330933,
      "rewards/margins": 1.0713183879852295,
      "rewards/rejected": -1.0512654781341553,
      "step": 40,
      "train_speed(iter/s)": 0.011248
    },
    {
      "epoch": 0.10311222885884942,
      "grad_norm": 3.900786876678467,
      "learning_rate": 0.00013666666666666666,
      "logits/chosen": -0.30438148975372314,
      "logits/rejected": -0.4660162031650543,
      "logps/chosen": -9.80126953125,
      "logps/rejected": -22.89883804321289,
      "loss": 1.0617499351501465,
      "memory(GiB)": 40.85,
      "nll_loss": 0.5348615646362305,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": 0.037312038242816925,
      "rewards/margins": 0.48836010694503784,
      "rewards/rejected": -0.4510480761528015,
      "step": 41,
      "train_speed(iter/s)": 0.011248
    },
    {
      "epoch": 0.10562716127004086,
      "grad_norm": 4.212996006011963,
      "learning_rate": 0.00014,
      "logits/chosen": -0.37392380833625793,
      "logits/rejected": -0.4811669588088989,
      "logps/chosen": -8.54138469696045,
      "logps/rejected": -24.88803482055664,
      "loss": 0.9449828267097473,
      "memory(GiB)": 40.85,
      "nll_loss": 0.40984830260276794,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": -0.078499935567379,
      "rewards/margins": 0.6149317026138306,
      "rewards/rejected": -0.6934316754341125,
      "step": 42,
      "train_speed(iter/s)": 0.011249
    },
    {
      "epoch": 0.10814209368123232,
      "grad_norm": 2.7297940254211426,
      "learning_rate": 0.00014333333333333334,
      "logits/chosen": -0.22235050797462463,
      "logits/rejected": -0.44656193256378174,
      "logps/chosen": -3.8628368377685547,
      "logps/rejected": -29.070890426635742,
      "loss": 0.6864454746246338,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3404179513454437,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.10101112723350525,
      "rewards/margins": 1.1784940958023071,
      "rewards/rejected": -1.0774829387664795,
      "step": 43,
      "train_speed(iter/s)": 0.011247
    },
    {
      "epoch": 0.11065702609242377,
      "grad_norm": 4.357929229736328,
      "learning_rate": 0.00014666666666666666,
      "logits/chosen": -0.3152369558811188,
      "logits/rejected": -0.4675106406211853,
      "logps/chosen": -8.47473430633545,
      "logps/rejected": -35.49666976928711,
      "loss": 0.8841890096664429,
      "memory(GiB)": 40.85,
      "nll_loss": 0.543793261051178,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": -0.2599925100803375,
      "rewards/margins": 1.5472975969314575,
      "rewards/rejected": -1.8072898387908936,
      "step": 44,
      "train_speed(iter/s)": 0.011248
    },
    {
      "epoch": 0.11317195850361522,
      "grad_norm": 4.053813934326172,
      "learning_rate": 0.00015000000000000001,
      "logits/chosen": -0.47932106256484985,
      "logits/rejected": -0.5357992053031921,
      "logps/chosen": -10.139131546020508,
      "logps/rejected": -29.30261993408203,
      "loss": 1.0090879201889038,
      "memory(GiB)": 40.85,
      "nll_loss": 0.6002873182296753,
      "rewards/accuracies": 0.75,
      "rewards/chosen": -0.2646394371986389,
      "rewards/margins": 1.3857942819595337,
      "rewards/rejected": -1.6504336595535278,
      "step": 45,
      "train_speed(iter/s)": 0.01125
    },
    {
      "epoch": 0.11568689091480666,
      "grad_norm": 3.4071342945098877,
      "learning_rate": 0.00015333333333333334,
      "logits/chosen": -0.35965389013290405,
      "logits/rejected": -0.4886631965637207,
      "logps/chosen": -6.492125988006592,
      "logps/rejected": -33.90357971191406,
      "loss": 0.9477238655090332,
      "memory(GiB)": 40.85,
      "nll_loss": 0.5519906878471375,
      "rewards/accuracies": 0.8125,
      "rewards/chosen": -0.13393068313598633,
      "rewards/margins": 1.3498430252075195,
      "rewards/rejected": -1.4837737083435059,
      "step": 46,
      "train_speed(iter/s)": 0.011251
    },
    {
      "epoch": 0.11820182332599811,
      "grad_norm": 1.5676898956298828,
      "learning_rate": 0.00015666666666666666,
      "logits/chosen": -0.3339039087295532,
      "logits/rejected": -0.5405474305152893,
      "logps/chosen": -5.18754768371582,
      "logps/rejected": -34.61940383911133,
      "loss": 0.5877978205680847,
      "memory(GiB)": 40.85,
      "nll_loss": 0.26233971118927,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": 0.04858784377574921,
      "rewards/margins": 1.4838428497314453,
      "rewards/rejected": -1.4352549314498901,
      "step": 47,
      "train_speed(iter/s)": 0.011252
    },
    {
      "epoch": 0.12071675573718957,
      "grad_norm": 1.7600055932998657,
      "learning_rate": 0.00016,
      "logits/chosen": -0.38554954528808594,
      "logits/rejected": -0.5349220633506775,
      "logps/chosen": -5.35024356842041,
      "logps/rejected": -30.936561584472656,
      "loss": 0.7445188760757446,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3484676480293274,
      "rewards/accuracies": 0.84375,
      "rewards/chosen": -0.04428477957844734,
      "rewards/margins": 1.158116340637207,
      "rewards/rejected": -1.2024011611938477,
      "step": 48,
      "train_speed(iter/s)": 0.011253
    },
    {
      "epoch": 0.12323168814838101,
      "grad_norm": 1.8286348581314087,
      "learning_rate": 0.00016333333333333334,
      "logits/chosen": -0.3060781955718994,
      "logits/rejected": -0.5333737134933472,
      "logps/chosen": -4.790343761444092,
      "logps/rejected": -32.540409088134766,
      "loss": 0.6686277985572815,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3360018730163574,
      "rewards/accuracies": 0.9375,
      "rewards/chosen": 0.0967080146074295,
      "rewards/margins": 1.285821795463562,
      "rewards/rejected": -1.1891138553619385,
      "step": 49,
      "train_speed(iter/s)": 0.011254
    },
    {
      "epoch": 0.12574662055957248,
      "grad_norm": 1.8983184099197388,
      "learning_rate": 0.0001666666666666667,
      "logits/chosen": -0.22582519054412842,
      "logits/rejected": -0.47035256028175354,
      "logps/chosen": -6.48522424697876,
      "logps/rejected": -32.73487091064453,
      "loss": 0.8076327443122864,
      "memory(GiB)": 40.85,
      "nll_loss": 0.3926582336425781,
      "rewards/accuracies": 0.78125,
      "rewards/chosen": 0.01478707417845726,
      "rewards/margins": 1.167083501815796,
      "rewards/rejected": -1.1522964239120483,
      "step": 50,
      "train_speed(iter/s)": 0.011253
    }
  ],
  "logging_steps": 1,
  "max_steps": 1191,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 3,
  "save_steps": 50,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 2.7419712375750656e+16,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}