matverest commited on
Commit
1ce7d9d
·
verified ·
1 Parent(s): c9f920e

Upload 15 files

Browse files
Files changed (6) hide show
  1. model.safetensors +1 -1
  2. optimizer.pt +1 -1
  3. rng_state.pth +1 -1
  4. scheduler.pt +1 -1
  5. trainer_state.json +59 -88
  6. training_args.bin +1 -1
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:83cc74d0d5909d2d8879aa922fb58039963c6f3cd976de52605d9d19608a23ff
3
  size 2384234968
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:470ad931266a6e96ba5a885406ab42d02b88b72338581c4a86550f9cc7d6ca17
3
  size 2384234968
optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e6fcac12a7c6675631610843bec77e53d42633ba080c920923a68c4636448ada
3
  size 4768667262
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cde182865a6d3d24b73e9485347b908e0449d66bb6e9edccc931a636295d2561
3
  size 4768667262
rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d2b5691046896d865f067a1958689168fc2411c74d2f82d596bd6a636b2b141b
3
  size 14244
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9196a1e708bf24d6abba41cce3f8558820acc3e50f9394c5955e29eb41ffea3d
3
  size 14244
scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:80938d2c342a9e9feb870ab78d4bc6c71c45abde7ade4df8bd1b2b97febc4209
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e9f54374167c346852156307ccec6d5c312ed574fd353a754e476da6abc305ce
3
  size 1064
trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 2.30208,
6
- "eval_steps": 100,
7
- "global_step": 900,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -16,147 +16,118 @@
16
  "loss": 1.0238,
17
  "step": 1
18
  },
 
 
 
 
 
 
 
19
  {
20
  "epoch": 0.256,
21
  "grad_norm": 2.3984222412109375,
22
  "learning_rate": 4.212765957446809e-06,
23
- "loss": 0.6317,
24
  "step": 100
25
  },
26
  {
27
- "epoch": 0.256,
28
- "eval_loss": 0.3901349604129791,
29
- "eval_runtime": 76.1829,
30
- "eval_samples_per_second": 16.408,
31
- "eval_steps_per_second": 8.204,
32
- "step": 100
33
  },
34
  {
35
  "epoch": 0.512,
36
  "grad_norm": 2.158310890197754,
37
  "learning_rate": 8.46808510638298e-06,
38
- "loss": 0.4072,
39
  "step": 200
40
  },
41
  {
42
- "epoch": 0.512,
43
- "eval_loss": 0.3636568784713745,
44
- "eval_runtime": 76.1675,
45
- "eval_samples_per_second": 16.411,
46
- "eval_steps_per_second": 8.206,
47
- "step": 200
48
  },
49
  {
50
  "epoch": 0.768,
51
- "grad_norm": 2.0863559246063232,
52
  "learning_rate": 9.885572470188207e-06,
53
- "loss": 0.3826,
54
  "step": 300
55
  },
56
  {
57
- "epoch": 0.768,
58
- "eval_loss": 0.3526187837123871,
59
- "eval_runtime": 76.2073,
60
- "eval_samples_per_second": 16.403,
61
- "eval_steps_per_second": 8.201,
62
- "step": 300
63
  },
64
  {
65
  "epoch": 1.02304,
66
- "grad_norm": 2.2784180641174316,
67
  "learning_rate": 9.2645127658466e-06,
68
- "loss": 0.3653,
69
  "step": 400
70
  },
71
  {
72
- "epoch": 1.02304,
73
- "eval_loss": 0.3516922891139984,
74
- "eval_runtime": 76.1603,
75
- "eval_samples_per_second": 16.413,
76
- "eval_steps_per_second": 8.206,
77
- "step": 400
78
  },
79
  {
80
  "epoch": 1.27904,
81
- "grad_norm": 2.1337344646453857,
82
  "learning_rate": 8.169538606063647e-06,
83
- "loss": 0.3122,
84
  "step": 500
85
  },
86
  {
87
- "epoch": 1.27904,
88
- "eval_loss": 0.3464358150959015,
89
- "eval_runtime": 76.195,
90
- "eval_samples_per_second": 16.405,
91
- "eval_steps_per_second": 8.203,
92
- "step": 500
93
  },
94
  {
95
  "epoch": 1.53504,
96
- "grad_norm": 2.1311352252960205,
97
  "learning_rate": 6.722334251421665e-06,
98
- "loss": 0.3107,
99
  "step": 600
100
  },
101
  {
102
- "epoch": 1.53504,
103
- "eval_loss": 0.34351983666419983,
104
- "eval_runtime": 76.1475,
105
- "eval_samples_per_second": 16.415,
106
- "eval_steps_per_second": 8.208,
107
- "step": 600
108
  },
109
  {
110
  "epoch": 1.79104,
111
- "grad_norm": 1.905997633934021,
112
  "learning_rate": 5.083727233997775e-06,
113
- "loss": 0.301,
114
  "step": 700
115
  },
116
  {
117
  "epoch": 1.79104,
118
- "eval_loss": 0.3379676640033722,
119
- "eval_runtime": 76.2095,
120
- "eval_samples_per_second": 16.402,
121
- "eval_steps_per_second": 8.201,
122
  "step": 700
123
- },
124
- {
125
- "epoch": 2.04608,
126
- "grad_norm": 2.4192748069763184,
127
- "learning_rate": 3.4358156257133644e-06,
128
- "loss": 0.2912,
129
- "step": 800
130
- },
131
- {
132
- "epoch": 2.04608,
133
- "eval_loss": 0.35626986622810364,
134
- "eval_runtime": 76.1989,
135
- "eval_samples_per_second": 16.404,
136
- "eval_steps_per_second": 8.202,
137
- "step": 800
138
- },
139
- {
140
- "epoch": 2.30208,
141
- "grad_norm": 2.3621625900268555,
142
- "learning_rate": 1.9617315158214363e-06,
143
- "loss": 0.2201,
144
- "step": 900
145
- },
146
- {
147
- "epoch": 2.30208,
148
- "eval_loss": 0.3607979118824005,
149
- "eval_runtime": 76.2076,
150
- "eval_samples_per_second": 16.403,
151
- "eval_steps_per_second": 8.201,
152
- "step": 900
153
  }
154
  ],
155
- "logging_steps": 100,
156
  "max_steps": 1173,
157
  "num_input_tokens_seen": 0,
158
  "num_train_epochs": 3,
159
- "save_steps": 900,
160
  "stateful_callbacks": {
161
  "TrainerControl": {
162
  "args": {
@@ -169,7 +140,7 @@
169
  "attributes": {}
170
  }
171
  },
172
- "total_flos": 1.5574906692226253e+17,
173
  "train_batch_size": 2,
174
  "trial_name": null,
175
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.79104,
6
+ "eval_steps": 700,
7
+ "global_step": 700,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
16
  "loss": 1.0238,
17
  "step": 1
18
  },
19
+ {
20
+ "epoch": 0.128,
21
+ "grad_norm": 3.0013201236724854,
22
+ "learning_rate": 2.0851063829787235e-06,
23
+ "loss": 0.8222,
24
+ "step": 50
25
+ },
26
  {
27
  "epoch": 0.256,
28
  "grad_norm": 2.3984222412109375,
29
  "learning_rate": 4.212765957446809e-06,
30
+ "loss": 0.445,
31
  "step": 100
32
  },
33
  {
34
+ "epoch": 0.384,
35
+ "grad_norm": 2.368490695953369,
36
+ "learning_rate": 6.3404255319148945e-06,
37
+ "loss": 0.4149,
38
+ "step": 150
 
39
  },
40
  {
41
  "epoch": 0.512,
42
  "grad_norm": 2.158310890197754,
43
  "learning_rate": 8.46808510638298e-06,
44
+ "loss": 0.3995,
45
  "step": 200
46
  },
47
  {
48
+ "epoch": 0.64,
49
+ "grad_norm": 2.212986707687378,
50
+ "learning_rate": 9.994504457428557e-06,
51
+ "loss": 0.3701,
52
+ "step": 250
 
53
  },
54
  {
55
  "epoch": 0.768,
56
+ "grad_norm": 2.0821216106414795,
57
  "learning_rate": 9.885572470188207e-06,
58
+ "loss": 0.3951,
59
  "step": 300
60
  },
61
  {
62
+ "epoch": 0.896,
63
+ "grad_norm": 2.1344685554504395,
64
+ "learning_rate": 9.639951230825433e-06,
65
+ "loss": 0.3777,
66
+ "step": 350
 
67
  },
68
  {
69
  "epoch": 1.02304,
70
+ "grad_norm": 2.2334532737731934,
71
  "learning_rate": 9.2645127658466e-06,
72
+ "loss": 0.353,
73
  "step": 400
74
  },
75
  {
76
+ "epoch": 1.15104,
77
+ "grad_norm": 2.0466365814208984,
78
+ "learning_rate": 8.76976114684395e-06,
79
+ "loss": 0.3095,
80
+ "step": 450
 
81
  },
82
  {
83
  "epoch": 1.27904,
84
+ "grad_norm": 2.1597046852111816,
85
  "learning_rate": 8.169538606063647e-06,
86
+ "loss": 0.3148,
87
  "step": 500
88
  },
89
  {
90
+ "epoch": 1.40704,
91
+ "grad_norm": 2.369905471801758,
92
+ "learning_rate": 7.480638256432977e-06,
93
+ "loss": 0.3089,
94
+ "step": 550
 
95
  },
96
  {
97
  "epoch": 1.53504,
98
+ "grad_norm": 2.1879630088806152,
99
  "learning_rate": 6.722334251421665e-06,
100
+ "loss": 0.3123,
101
  "step": 600
102
  },
103
  {
104
+ "epoch": 1.66304,
105
+ "grad_norm": 1.9208930730819702,
106
+ "learning_rate": 5.915842529992632e-06,
107
+ "loss": 0.2917,
108
+ "step": 650
 
109
  },
110
  {
111
  "epoch": 1.79104,
112
+ "grad_norm": 1.9313366413116455,
113
  "learning_rate": 5.083727233997775e-06,
114
+ "loss": 0.3105,
115
  "step": 700
116
  },
117
  {
118
  "epoch": 1.79104,
119
+ "eval_loss": 0.3375703692436218,
120
+ "eval_runtime": 78.8007,
121
+ "eval_samples_per_second": 15.863,
122
+ "eval_steps_per_second": 7.931,
123
  "step": 700
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
124
  }
125
  ],
126
+ "logging_steps": 50,
127
  "max_steps": 1173,
128
  "num_input_tokens_seen": 0,
129
  "num_train_epochs": 3,
130
+ "save_steps": 700,
131
  "stateful_callbacks": {
132
  "TrainerControl": {
133
  "args": {
 
140
  "attributes": {}
141
  }
142
  },
143
+ "total_flos": 1.2117424625575526e+17,
144
  "train_batch_size": 2,
145
  "trial_name": null,
146
  "trial_params": null
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c7ee02a0cd4f7b137ba78feabcbed64937cec52a6b8a3f66a9f57da227b8f821
3
  size 5304
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4dc9cd2c46e7e2983902b8d6f466821351988fe7f14f96e63e9e4fa6d81ad500
3
  size 5304