PRATYUSH-BHARDWAJ commited on
Commit
ff43960
·
verified ·
1 Parent(s): ba7fcf9

SFT checkpoint step 32

Browse files
checkpoints/checkpoint-32/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7ca1f6f7d5be6aa02d62c533e798347df7d8cbe28dde19a10b2279b55644322e
3
  size 204500912
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ac4185cd050c8ec04df1a7c0b5cfff97f1434f2febe75749a9af9b10f9170d3f
3
  size 204500912
checkpoints/checkpoint-32/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b8806c4e8215cc1261a5dcbc0f390465d115e52f8c315386fd1b579af97c8b16
3
  size 620569547
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:17f3289f84682bc9a5ae016c1f3057446893c447b0c491592f1c94003cf463fe
3
  size 620569547
checkpoints/checkpoint-32/scaler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4d4554f823bdad60cb7285b04abc5c634f3a2998e13f5dae9f5b55c2226bb622
3
  size 1383
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d6c72dbf2bb42cbd57c53b8628dd5b5abb38c5c44175ac9f4c0a898279d87359
3
  size 1383
checkpoints/checkpoint-32/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e4512d0083440109748e439e94524c7e78fe07765f616adfc020fe86a3deba34
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ce3ab2dc5a54221473fefd9014c9838afd55c2c20a5337fbeed20c5a935ff456
3
  size 1465
checkpoints/checkpoint-32/time_state.json CHANGED
@@ -1 +1 @@
1
- {"consumed_seconds": 332.8946771621704, "global_step": 32}
 
1
+ {"consumed_seconds": 344.63673210144043, "global_step": 32}
checkpoints/checkpoint-32/trainer_state.json CHANGED
@@ -17,15 +17,15 @@
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
- "train_runtime": 44.9864,
21
- "train_tokens_per_second": 33.21
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
  "eval_loss": 5.31978178024292,
26
  "eval_num_tokens": 4980.0,
27
- "eval_runtime": 28.6663,
28
- "eval_samples_per_second": 1.047,
29
  "eval_steps_per_second": 0.279,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
@@ -34,102 +34,102 @@
34
  "epoch": 0.1391304347826087,
35
  "eval_loss": 5.31978178024292,
36
  "eval_num_tokens": 9004.0,
37
- "eval_runtime": 3.5559,
38
- "eval_samples_per_second": 8.437,
39
- "eval_steps_per_second": 2.25,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
- "grad_norm": 28.138591766357422,
46
  "learning_rate": 0.0,
47
  "loss": 2.5477417839898004,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
- "train_runtime": 145.0656,
52
- "train_tokens_per_second": 76.827
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
- "eval_loss": 1.795594573020935,
57
  "eval_num_tokens": 13293.0,
58
- "eval_runtime": 3.5484,
59
- "eval_samples_per_second": 8.455,
60
- "eval_steps_per_second": 2.255,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
- "eval_loss": 0.5860968232154846,
67
  "eval_num_tokens": 17742.0,
68
- "eval_runtime": 3.4658,
69
- "eval_samples_per_second": 8.656,
70
- "eval_steps_per_second": 2.308,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
- "grad_norm": 7.353201389312744,
77
- "learning_rate": 0.0001442909649383465,
78
- "loss": 0.8008382797241211,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
- "train_runtime": 227.664,
83
- "train_tokens_per_second": 89.008
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
- "eval_loss": 0.39688172936439514,
88
  "eval_num_tokens": 20264.0,
89
- "eval_runtime": 3.494,
90
- "eval_samples_per_second": 8.586,
91
- "eval_steps_per_second": 2.29,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
- "eval_loss": 0.5452550053596497,
98
  "eval_num_tokens": 24990.0,
99
- "eval_runtime": 3.5856,
100
- "eval_samples_per_second": 8.367,
101
- "eval_steps_per_second": 2.231,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  },
105
  {
106
  "epoch": 0.48695652173913045,
107
- "eval_loss": 0.31608301401138306,
108
  "eval_num_tokens": 28628.0,
109
- "eval_runtime": 3.5529,
110
- "eval_samples_per_second": 8.444,
111
- "eval_steps_per_second": 2.252,
112
  "num_input_tokens_seen": 28628,
113
  "step": 28
114
  },
115
  {
116
  "epoch": 0.5217391304347826,
117
- "grad_norm": 2.936347007751465,
118
- "learning_rate": 0.00011840034721348544,
119
- "loss": 0.20213119983673095,
120
  "num_input_tokens_seen": 30604,
121
  "num_tokens": 30604.0,
122
  "step": 30,
123
- "train_runtime": 314.4011,
124
- "train_tokens_per_second": 97.341
125
  },
126
  {
127
  "epoch": 0.5565217391304348,
128
- "eval_loss": 0.3312884569168091,
129
  "eval_num_tokens": 33017.0,
130
- "eval_runtime": 3.5533,
131
- "eval_samples_per_second": 8.443,
132
- "eval_steps_per_second": 2.251,
133
  "num_input_tokens_seen": 33017,
134
  "step": 32
135
  }
 
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
+ "train_runtime": 42.4619,
21
+ "train_tokens_per_second": 35.185
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
  "eval_loss": 5.31978178024292,
26
  "eval_num_tokens": 4980.0,
27
+ "eval_runtime": 28.7144,
28
+ "eval_samples_per_second": 1.045,
29
  "eval_steps_per_second": 0.279,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
 
34
  "epoch": 0.1391304347826087,
35
  "eval_loss": 5.31978178024292,
36
  "eval_num_tokens": 9004.0,
37
+ "eval_runtime": 3.4006,
38
+ "eval_samples_per_second": 8.822,
39
+ "eval_steps_per_second": 2.353,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
+ "grad_norm": 28.1390438079834,
46
  "learning_rate": 0.0,
47
  "loss": 2.5477417839898004,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
+ "train_runtime": 146.4448,
52
+ "train_tokens_per_second": 76.104
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
+ "eval_loss": 1.7850792407989502,
57
  "eval_num_tokens": 13293.0,
58
+ "eval_runtime": 3.4816,
59
+ "eval_samples_per_second": 8.617,
60
+ "eval_steps_per_second": 2.298,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
+ "eval_loss": 0.5965744256973267,
67
  "eval_num_tokens": 17742.0,
68
+ "eval_runtime": 3.4391,
69
+ "eval_samples_per_second": 8.723,
70
+ "eval_steps_per_second": 2.326,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
+ "grad_norm": 6.518080711364746,
77
+ "learning_rate": 0.0001425726650926814,
78
+ "loss": 0.7919160842895507,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
+ "train_runtime": 241.9804,
83
+ "train_tokens_per_second": 83.742
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
+ "eval_loss": 0.6307523250579834,
88
  "eval_num_tokens": 20264.0,
89
+ "eval_runtime": 3.512,
90
+ "eval_samples_per_second": 8.542,
91
+ "eval_steps_per_second": 2.278,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
+ "eval_loss": 0.3135659396648407,
98
  "eval_num_tokens": 24990.0,
99
+ "eval_runtime": 3.4341,
100
+ "eval_samples_per_second": 8.736,
101
+ "eval_steps_per_second": 2.33,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  },
105
  {
106
  "epoch": 0.48695652173913045,
107
+ "eval_loss": 0.4761301875114441,
108
  "eval_num_tokens": 28628.0,
109
+ "eval_runtime": 3.4198,
110
+ "eval_samples_per_second": 8.772,
111
+ "eval_steps_per_second": 2.339,
112
  "num_input_tokens_seen": 28628,
113
  "step": 28
114
  },
115
  {
116
  "epoch": 0.5217391304347826,
117
+ "grad_norm": 3.650630235671997,
118
+ "learning_rate": 0.00011490240573865023,
119
+ "loss": 0.22239422798156738,
120
  "num_input_tokens_seen": 30604,
121
  "num_tokens": 30604.0,
122
  "step": 30,
123
+ "train_runtime": 326.8185,
124
+ "train_tokens_per_second": 93.642
125
  },
126
  {
127
  "epoch": 0.5565217391304348,
128
+ "eval_loss": 0.2599254846572876,
129
  "eval_num_tokens": 33017.0,
130
+ "eval_runtime": 3.409,
131
+ "eval_samples_per_second": 8.8,
132
+ "eval_steps_per_second": 2.347,
133
  "num_input_tokens_seen": 33017,
134
  "step": 32
135
  }