alexiaassis commited on
Commit
63bb3aa
·
verified ·
1 Parent(s): 7ed7993

Upload folder using huggingface_hub

Browse files
README.md CHANGED
@@ -36,7 +36,7 @@ More information needed
36
  ### Training hyperparameters
37
 
38
  The following hyperparameters were used during training:
39
- - learning_rate: 3e-05
40
  - train_batch_size: 4
41
  - eval_batch_size: 8
42
  - seed: 42
@@ -45,7 +45,6 @@ The following hyperparameters were used during training:
45
  - optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
46
  - lr_scheduler_type: cosine
47
  - num_epochs: 3.0
48
- - mixed_precision_training: Native AMP
49
 
50
  ### Training results
51
 
 
36
  ### Training hyperparameters
37
 
38
  The following hyperparameters were used during training:
39
+ - learning_rate: 1e-05
40
  - train_batch_size: 4
41
  - eval_batch_size: 8
42
  - seed: 42
 
45
  - optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
46
  - lr_scheduler_type: cosine
47
  - num_epochs: 3.0
 
48
 
49
  ### Training results
50
 
adapter_config.json CHANGED
@@ -28,154 +28,154 @@
28
  "rank_pattern": {},
29
  "revision": null,
30
  "target_modules": [
31
- "language_model.layers.6.self_attn.v_proj",
32
- "37.self_attn.v_proj",
33
- "46.self_attn.q_proj",
34
- "32.self_attn.v_proj",
35
- "29.self_attn.q_proj",
36
- "language_model.layers.22.self_attn.v_proj",
37
- "language_model.layers.26.self_attn.v_proj",
38
- "language_model.layers.24.self_attn.v_proj",
39
- "language_model.layers.9.self_attn.q_proj",
40
- "27.self_attn.k_proj",
41
- "47.self_attn.k_proj",
42
- "language_model.layers.19.self_attn.k_proj",
43
- "38.self_attn.q_proj",
44
- "44.self_attn.k_proj",
45
- "31.self_attn.q_proj",
46
- "31.self_attn.v_proj",
47
- "language_model.layers.4.self_attn.v_proj",
48
- "40.self_attn.q_proj",
49
- "language_model.layers.10.self_attn.k_proj",
50
- "27.self_attn.q_proj",
51
- "language_model.layers.6.self_attn.q_proj",
52
- "language_model.layers.9.self_attn.k_proj",
53
  "33.self_attn.q_proj",
54
- "37.self_attn.k_proj",
55
- "language_model.layers.0.self_attn.v_proj",
56
- "language_model.layers.17.self_attn.v_proj",
57
- "28.self_attn.q_proj",
58
- "29.self_attn.k_proj",
59
- "46.self_attn.k_proj",
60
- "language_model.layers.26.self_attn.q_proj",
61
- "33.self_attn.k_proj",
62
- "language_model.layers.23.self_attn.v_proj",
63
- "36.self_attn.q_proj",
64
- "32.self_attn.q_proj",
65
- "language_model.layers.23.self_attn.q_proj",
66
- "29.self_attn.v_proj",
67
- "language_model.layers.18.self_attn.k_proj",
68
- "language_model.layers.21.self_attn.q_proj",
69
- "40.self_attn.v_proj",
70
- "language_model.layers.10.self_attn.q_proj",
71
- "30.self_attn.k_proj",
72
- "language_model.layers.25.self_attn.q_proj",
73
- "language_model.layers.6.self_attn.k_proj",
74
- "43.self_attn.k_proj",
75
- "language_model.layers.14.self_attn.k_proj",
76
- "language_model.layers.4.self_attn.q_proj",
77
- "41.self_attn.k_proj",
78
- "30.self_attn.v_proj",
79
- "45.self_attn.q_proj",
80
- "language_model.layers.18.self_attn.q_proj",
81
- "language_model.layers.7.self_attn.v_proj",
82
- "language_model.layers.25.self_attn.v_proj",
83
  "language_model.layers.26.self_attn.k_proj",
84
- "language_model.layers.15.self_attn.k_proj",
85
- "language_model.layers.21.self_attn.k_proj",
86
- "language_model.layers.20.self_attn.q_proj",
87
- "31.self_attn.k_proj",
88
- "language_model.layers.1.self_attn.q_proj",
89
- "language_model.layers.24.self_attn.k_proj",
90
- "45.self_attn.v_proj",
91
- "36.self_attn.k_proj",
92
- "language_model.layers.3.self_attn.v_proj",
93
- "language_model.layers.12.self_attn.v_proj",
94
  "language_model.layers.25.self_attn.k_proj",
95
- "language_model.layers.18.self_attn.v_proj",
96
- "down_proj",
97
- "language_model.layers.12.self_attn.k_proj",
98
- "language_model.layers.14.self_attn.q_proj",
99
  "42.self_attn.v_proj",
100
- "language_model.layers.3.self_attn.k_proj",
101
- "language_model.layers.10.self_attn.v_proj",
102
- "language_model.layers.11.self_attn.q_proj",
103
- "36.self_attn.v_proj",
104
- "44.self_attn.q_proj",
105
- "language_model.layers.5.self_attn.k_proj",
106
- "38.self_attn.v_proj",
107
- "35.self_attn.q_proj",
108
  "language_model.layers.15.self_attn.v_proj",
 
 
109
  "45.self_attn.k_proj",
110
- "o_proj",
111
- "language_model.layers.7.self_attn.k_proj",
112
- "language_model.layers.13.self_attn.v_proj",
113
- "27.self_attn.v_proj",
114
- "language_model.layers.8.self_attn.k_proj",
115
- "language_model.layers.20.self_attn.k_proj",
116
- "46.self_attn.v_proj",
117
  "34.self_attn.v_proj",
 
 
 
118
  "34.self_attn.q_proj",
119
- "language_model.layers.12.self_attn.q_proj",
120
- "language_model.layers.17.self_attn.k_proj",
121
  "language_model.layers.2.self_attn.v_proj",
122
- "39.self_attn.v_proj",
123
- "language_model.layers.4.self_attn.k_proj",
124
- "41.self_attn.q_proj",
125
- "language_model.layers.8.self_attn.q_proj",
 
 
 
 
126
  "39.self_attn.q_proj",
127
- "language_model.layers.0.self_attn.k_proj",
128
- "language_model.layers.21.self_attn.v_proj",
129
- "39.self_attn.k_proj",
130
- "47.self_attn.q_proj",
131
- "32.self_attn.k_proj",
132
- "43.self_attn.v_proj",
133
  "language_model.layers.2.self_attn.q_proj",
134
- "47.self_attn.v_proj",
135
- "37.self_attn.q_proj",
136
- "language_model.layers.19.self_attn.v_proj",
 
 
 
 
137
  "language_model.layers.13.self_attn.k_proj",
138
- "42.self_attn.k_proj",
139
- "language_model.layers.23.self_attn.k_proj",
 
 
 
 
 
140
  "language_model.layers.3.self_attn.q_proj",
141
- "language_model.layers.20.self_attn.v_proj",
142
- "30.self_attn.q_proj",
 
 
 
 
 
 
 
 
 
143
  "28.self_attn.k_proj",
144
- "language_model.layers.22.self_attn.k_proj",
145
- "language_model.layers.19.self_attn.q_proj",
146
- "language_model.layers.2.self_attn.k_proj",
147
- "language_model.layers.1.self_attn.k_proj",
148
  "language_model.layers.13.self_attn.q_proj",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
149
  "language_model.layers.0.self_attn.q_proj",
150
- "44.self_attn.v_proj",
151
- "up_proj",
 
 
 
 
152
  "33.self_attn.v_proj",
153
- "language_model.layers.15.self_attn.q_proj",
154
- "language_model.layers.8.self_attn.v_proj",
155
- "language_model.layers.16.self_attn.v_proj",
156
- "language_model.layers.16.self_attn.k_proj",
157
- "35.self_attn.k_proj",
158
- "42.self_attn.q_proj",
159
- "language_model.layers.1.self_attn.v_proj",
160
- "34.self_attn.k_proj",
161
- "43.self_attn.q_proj",
162
- "language_model.layers.9.self_attn.v_proj",
163
  "language_model.layers.17.self_attn.q_proj",
164
- "28.self_attn.v_proj",
 
 
 
 
 
165
  "38.self_attn.k_proj",
166
- "language_model.layers.11.self_attn.k_proj",
167
- "40.self_attn.k_proj",
 
 
 
 
 
 
168
  "language_model.layers.7.self_attn.q_proj",
169
- "gate_proj",
170
- "language_model.layers.16.self_attn.q_proj",
171
- "language_model.layers.24.self_attn.q_proj",
172
- "language_model.layers.5.self_attn.q_proj",
173
- "language_model.layers.14.self_attn.v_proj",
174
- "language_model.layers.22.self_attn.q_proj",
175
- "language_model.layers.5.self_attn.v_proj",
176
- "41.self_attn.v_proj",
 
 
 
 
 
 
 
 
 
 
 
 
177
  "35.self_attn.v_proj",
178
- "language_model.layers.11.self_attn.v_proj"
 
 
 
 
 
 
179
  ],
180
  "task_type": "CAUSAL_LM",
181
  "trainable_token_indices": null,
 
28
  "rank_pattern": {},
29
  "revision": null,
30
  "target_modules": [
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
31
  "33.self_attn.q_proj",
32
+ "up_proj",
33
+ "language_model.layers.5.self_attn.k_proj",
34
+ "language_model.layers.11.self_attn.v_proj",
35
+ "32.self_attn.k_proj",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
36
  "language_model.layers.26.self_attn.k_proj",
37
+ "38.self_attn.v_proj",
38
+ "36.self_attn.v_proj",
39
+ "39.self_attn.k_proj",
40
+ "language_model.layers.5.self_attn.q_proj",
41
+ "43.self_attn.k_proj",
42
+ "language_model.layers.16.self_attn.v_proj",
43
+ "37.self_attn.q_proj",
44
+ "language_model.layers.20.self_attn.k_proj",
 
 
45
  "language_model.layers.25.self_attn.k_proj",
46
+ "language_model.layers.0.self_attn.k_proj",
47
+ "language_model.layers.8.self_attn.q_proj",
 
 
48
  "42.self_attn.v_proj",
49
+ "38.self_attn.q_proj",
 
 
 
 
 
 
 
50
  "language_model.layers.15.self_attn.v_proj",
51
+ "language_model.layers.11.self_attn.k_proj",
52
+ "language_model.layers.21.self_attn.v_proj",
53
  "45.self_attn.k_proj",
 
 
 
 
 
 
 
54
  "34.self_attn.v_proj",
55
+ "language_model.layers.16.self_attn.q_proj",
56
+ "language_model.layers.24.self_attn.q_proj",
57
+ "language_model.layers.19.self_attn.k_proj",
58
  "34.self_attn.q_proj",
 
 
59
  "language_model.layers.2.self_attn.v_proj",
60
+ "language_model.layers.6.self_attn.v_proj",
61
+ "33.self_attn.k_proj",
62
+ "32.self_attn.v_proj",
63
+ "41.self_attn.v_proj",
64
+ "language_model.layers.14.self_attn.q_proj",
65
+ "language_model.layers.23.self_attn.k_proj",
66
+ "30.self_attn.k_proj",
67
+ "40.self_attn.k_proj",
68
  "39.self_attn.q_proj",
69
+ "language_model.layers.20.self_attn.q_proj",
70
+ "28.self_attn.v_proj",
71
+ "language_model.layers.8.self_attn.k_proj",
72
+ "language_model.layers.9.self_attn.k_proj",
73
+ "47.self_attn.k_proj",
74
+ "gate_proj",
75
  "language_model.layers.2.self_attn.q_proj",
76
+ "language_model.layers.1.self_attn.q_proj",
77
+ "language_model.layers.7.self_attn.k_proj",
78
+ "language_model.layers.5.self_attn.v_proj",
79
+ "30.self_attn.q_proj",
80
+ "language_model.layers.7.self_attn.v_proj",
81
+ "45.self_attn.v_proj",
82
+ "language_model.layers.10.self_attn.q_proj",
83
  "language_model.layers.13.self_attn.k_proj",
84
+ "43.self_attn.v_proj",
85
+ "44.self_attn.k_proj",
86
+ "43.self_attn.q_proj",
87
+ "language_model.layers.2.self_attn.k_proj",
88
+ "language_model.layers.10.self_attn.v_proj",
89
+ "language_model.layers.17.self_attn.k_proj",
90
+ "o_proj",
91
  "language_model.layers.3.self_attn.q_proj",
92
+ "44.self_attn.q_proj",
93
+ "language_model.layers.18.self_attn.k_proj",
94
+ "language_model.layers.25.self_attn.v_proj",
95
+ "45.self_attn.q_proj",
96
+ "language_model.layers.12.self_attn.q_proj",
97
+ "29.self_attn.v_proj",
98
+ "language_model.layers.18.self_attn.v_proj",
99
+ "language_model.layers.15.self_attn.q_proj",
100
+ "down_proj",
101
+ "42.self_attn.q_proj",
102
+ "language_model.layers.8.self_attn.v_proj",
103
  "28.self_attn.k_proj",
104
+ "31.self_attn.q_proj",
 
 
 
105
  "language_model.layers.13.self_attn.q_proj",
106
+ "language_model.layers.1.self_attn.v_proj",
107
+ "31.self_attn.k_proj",
108
+ "language_model.layers.20.self_attn.v_proj",
109
+ "language_model.layers.18.self_attn.q_proj",
110
+ "language_model.layers.23.self_attn.v_proj",
111
+ "language_model.layers.6.self_attn.q_proj",
112
+ "language_model.layers.10.self_attn.k_proj",
113
+ "language_model.layers.26.self_attn.v_proj",
114
+ "40.self_attn.q_proj",
115
+ "36.self_attn.k_proj",
116
+ "language_model.layers.13.self_attn.v_proj",
117
+ "language_model.layers.23.self_attn.q_proj",
118
+ "42.self_attn.k_proj",
119
+ "27.self_attn.v_proj",
120
+ "27.self_attn.k_proj",
121
+ "30.self_attn.v_proj",
122
+ "27.self_attn.q_proj",
123
  "language_model.layers.0.self_attn.q_proj",
124
+ "language_model.layers.0.self_attn.v_proj",
125
+ "31.self_attn.v_proj",
126
+ "language_model.layers.4.self_attn.v_proj",
127
+ "language_model.layers.25.self_attn.q_proj",
128
+ "language_model.layers.22.self_attn.q_proj",
129
+ "language_model.layers.12.self_attn.v_proj",
130
  "33.self_attn.v_proj",
131
+ "37.self_attn.v_proj",
132
+ "41.self_attn.k_proj",
133
+ "language_model.layers.4.self_attn.k_proj",
 
 
 
 
 
 
 
134
  "language_model.layers.17.self_attn.q_proj",
135
+ "language_model.layers.21.self_attn.q_proj",
136
+ "language_model.layers.16.self_attn.k_proj",
137
+ "language_model.layers.6.self_attn.k_proj",
138
+ "46.self_attn.k_proj",
139
+ "language_model.layers.14.self_attn.v_proj",
140
+ "40.self_attn.v_proj",
141
  "38.self_attn.k_proj",
142
+ "language_model.layers.9.self_attn.q_proj",
143
+ "language_model.layers.26.self_attn.q_proj",
144
+ "language_model.layers.24.self_attn.v_proj",
145
+ "29.self_attn.q_proj",
146
+ "41.self_attn.q_proj",
147
+ "language_model.layers.19.self_attn.v_proj",
148
+ "language_model.layers.22.self_attn.v_proj",
149
+ "language_model.layers.21.self_attn.k_proj",
150
  "language_model.layers.7.self_attn.q_proj",
151
+ "32.self_attn.q_proj",
152
+ "language_model.layers.15.self_attn.k_proj",
153
+ "language_model.layers.12.self_attn.k_proj",
154
+ "39.self_attn.v_proj",
155
+ "language_model.layers.9.self_attn.v_proj",
156
+ "35.self_attn.k_proj",
157
+ "language_model.layers.19.self_attn.q_proj",
158
+ "28.self_attn.q_proj",
159
+ "language_model.layers.14.self_attn.k_proj",
160
+ "language_model.layers.3.self_attn.k_proj",
161
+ "language_model.layers.1.self_attn.k_proj",
162
+ "37.self_attn.k_proj",
163
+ "34.self_attn.k_proj",
164
+ "language_model.layers.3.self_attn.v_proj",
165
+ "36.self_attn.q_proj",
166
+ "47.self_attn.v_proj",
167
+ "44.self_attn.v_proj",
168
+ "29.self_attn.k_proj",
169
+ "46.self_attn.q_proj",
170
+ "46.self_attn.v_proj",
171
  "35.self_attn.v_proj",
172
+ "language_model.layers.22.self_attn.k_proj",
173
+ "language_model.layers.11.self_attn.q_proj",
174
+ "language_model.layers.4.self_attn.q_proj",
175
+ "35.self_attn.q_proj",
176
+ "47.self_attn.q_proj",
177
+ "language_model.layers.24.self_attn.k_proj",
178
+ "language_model.layers.17.self_attn.v_proj"
179
  ],
180
  "task_type": "CAUSAL_LM",
181
  "trainable_token_indices": null,
adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1a98dbf0225d0bdfaad0af249d68fad53159cddecf45b2ddc7f14abd4b0e7ba1
3
  size 131040264
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:67b732d78c0543831c924f30a3e9f4ece7c9a51233bdd3e7eb43386b23a450d0
3
  size 131040264
all_results.json CHANGED
@@ -1,9 +1,9 @@
1
  {
2
  "epoch": 3.0,
3
- "num_input_tokens_seen": 3722368,
4
- "total_flos": 2.5033214310893568e+17,
5
- "train_loss": 0.0,
6
- "train_runtime": 3072.4201,
7
- "train_samples_per_second": 3.628,
8
- "train_steps_per_second": 0.454
9
  }
 
1
  {
2
  "epoch": 3.0,
3
+ "num_input_tokens_seen": 6120032,
4
+ "total_flos": 4.115769119160883e+17,
5
+ "train_loss": 0.1491297289889346,
6
+ "train_runtime": 4379.932,
7
+ "train_samples_per_second": 2.545,
8
+ "train_steps_per_second": 0.318
9
  }
chat_template.jinja CHANGED
@@ -1,9 +1,47 @@
1
- {% set system_message = 'Below is an instruction that describes a task. Write a response that appropriately completes the request.
 
 
 
2
 
3
- ' %}{% if messages[0]['role'] == 'system' %}{% set loop_messages = messages[1:] %}{% set system_message = messages[0]['content'] %}{% else %}{% set loop_messages = messages %}{% endif %}{% if system_message is defined %}{{ system_message }}{% endif %}{% for message in loop_messages %}{% set content = message['content'] %}{% if message['role'] == 'user' %}{{ '### Instruction:
4
- ' + content + '
 
5
 
6
- ### Response:
7
- ' }}{% elif message['role'] == 'assistant' %}{{ content + '<eos>' + '
8
-
9
- ' }}{% endif %}{% endfor %}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {{ bos_token }}
2
+ {%- if messages[0]['role'] == 'system' -%}
3
+ {%- if messages[0]['content'] is string -%}
4
+ {%- set first_user_prefix = messages[0]['content'] + '
5
 
6
+ ' -%}
7
+ {%- else -%}
8
+ {%- set first_user_prefix = messages[0]['content'][0]['text'] + '
9
 
10
+ ' -%}
11
+ {%- endif -%}
12
+ {%- set loop_messages = messages[1:] -%}
13
+ {%- else -%}
14
+ {%- set first_user_prefix = "" -%}
15
+ {%- set loop_messages = messages -%}
16
+ {%- endif -%}
17
+ {%- for message in loop_messages -%}
18
+ {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}
19
+ {{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }}
20
+ {%- endif -%}
21
+ {%- if (message['role'] == 'assistant') -%}
22
+ {%- set role = "model" -%}
23
+ {%- else -%}
24
+ {%- set role = message['role'] -%}
25
+ {%- endif -%}
26
+ {{ '<start_of_turn>' + role + '
27
+ ' + (first_user_prefix if loop.first else "") }}
28
+ {%- if message['content'] is string -%}
29
+ {{ message['content'] | trim }}
30
+ {%- elif message['content'] is iterable -%}
31
+ {%- for item in message['content'] -%}
32
+ {%- if item['type'] == 'image' -%}
33
+ {{ '<start_of_image>' }}
34
+ {%- elif item['type'] == 'text' -%}
35
+ {{ item['text'] | trim }}
36
+ {%- endif -%}
37
+ {%- endfor -%}
38
+ {%- else -%}
39
+ {{ raise_exception("Invalid content type") }}
40
+ {%- endif -%}
41
+ {{ '<end_of_turn>
42
+ ' }}
43
+ {%- endfor -%}
44
+ {%- if add_generation_prompt -%}
45
+ {{'<start_of_turn>model
46
+ '}}
47
+ {%- endif -%}
checkpoint-1000/adapter_config.json CHANGED
@@ -28,154 +28,154 @@
28
  "rank_pattern": {},
29
  "revision": null,
30
  "target_modules": [
31
- "language_model.layers.6.self_attn.v_proj",
32
- "37.self_attn.v_proj",
33
- "46.self_attn.q_proj",
34
- "32.self_attn.v_proj",
35
- "29.self_attn.q_proj",
36
- "language_model.layers.22.self_attn.v_proj",
37
- "language_model.layers.26.self_attn.v_proj",
38
- "language_model.layers.24.self_attn.v_proj",
39
- "language_model.layers.9.self_attn.q_proj",
40
- "27.self_attn.k_proj",
41
- "47.self_attn.k_proj",
42
- "language_model.layers.19.self_attn.k_proj",
43
- "38.self_attn.q_proj",
44
- "44.self_attn.k_proj",
45
- "31.self_attn.q_proj",
46
- "31.self_attn.v_proj",
47
- "language_model.layers.4.self_attn.v_proj",
48
- "40.self_attn.q_proj",
49
- "language_model.layers.10.self_attn.k_proj",
50
- "27.self_attn.q_proj",
51
- "language_model.layers.6.self_attn.q_proj",
52
- "language_model.layers.9.self_attn.k_proj",
53
  "33.self_attn.q_proj",
54
- "37.self_attn.k_proj",
55
- "language_model.layers.0.self_attn.v_proj",
56
- "language_model.layers.17.self_attn.v_proj",
57
- "28.self_attn.q_proj",
58
- "29.self_attn.k_proj",
59
- "46.self_attn.k_proj",
60
- "language_model.layers.26.self_attn.q_proj",
61
- "33.self_attn.k_proj",
62
- "language_model.layers.23.self_attn.v_proj",
63
- "36.self_attn.q_proj",
64
- "32.self_attn.q_proj",
65
- "language_model.layers.23.self_attn.q_proj",
66
- "29.self_attn.v_proj",
67
- "language_model.layers.18.self_attn.k_proj",
68
- "language_model.layers.21.self_attn.q_proj",
69
- "40.self_attn.v_proj",
70
- "language_model.layers.10.self_attn.q_proj",
71
- "30.self_attn.k_proj",
72
- "language_model.layers.25.self_attn.q_proj",
73
- "language_model.layers.6.self_attn.k_proj",
74
- "43.self_attn.k_proj",
75
- "language_model.layers.14.self_attn.k_proj",
76
- "language_model.layers.4.self_attn.q_proj",
77
- "41.self_attn.k_proj",
78
- "30.self_attn.v_proj",
79
- "45.self_attn.q_proj",
80
- "language_model.layers.18.self_attn.q_proj",
81
- "language_model.layers.7.self_attn.v_proj",
82
- "language_model.layers.25.self_attn.v_proj",
83
  "language_model.layers.26.self_attn.k_proj",
84
- "language_model.layers.15.self_attn.k_proj",
85
- "language_model.layers.21.self_attn.k_proj",
86
- "language_model.layers.20.self_attn.q_proj",
87
- "31.self_attn.k_proj",
88
- "language_model.layers.1.self_attn.q_proj",
89
- "language_model.layers.24.self_attn.k_proj",
90
- "45.self_attn.v_proj",
91
- "36.self_attn.k_proj",
92
- "language_model.layers.3.self_attn.v_proj",
93
- "language_model.layers.12.self_attn.v_proj",
94
  "language_model.layers.25.self_attn.k_proj",
95
- "language_model.layers.18.self_attn.v_proj",
96
- "down_proj",
97
- "language_model.layers.12.self_attn.k_proj",
98
- "language_model.layers.14.self_attn.q_proj",
99
  "42.self_attn.v_proj",
100
- "language_model.layers.3.self_attn.k_proj",
101
- "language_model.layers.10.self_attn.v_proj",
102
- "language_model.layers.11.self_attn.q_proj",
103
- "36.self_attn.v_proj",
104
- "44.self_attn.q_proj",
105
- "language_model.layers.5.self_attn.k_proj",
106
- "38.self_attn.v_proj",
107
- "35.self_attn.q_proj",
108
  "language_model.layers.15.self_attn.v_proj",
 
 
109
  "45.self_attn.k_proj",
110
- "o_proj",
111
- "language_model.layers.7.self_attn.k_proj",
112
- "language_model.layers.13.self_attn.v_proj",
113
- "27.self_attn.v_proj",
114
- "language_model.layers.8.self_attn.k_proj",
115
- "language_model.layers.20.self_attn.k_proj",
116
- "46.self_attn.v_proj",
117
  "34.self_attn.v_proj",
 
 
 
118
  "34.self_attn.q_proj",
119
- "language_model.layers.12.self_attn.q_proj",
120
- "language_model.layers.17.self_attn.k_proj",
121
  "language_model.layers.2.self_attn.v_proj",
122
- "39.self_attn.v_proj",
123
- "language_model.layers.4.self_attn.k_proj",
124
- "41.self_attn.q_proj",
125
- "language_model.layers.8.self_attn.q_proj",
 
 
 
 
126
  "39.self_attn.q_proj",
127
- "language_model.layers.0.self_attn.k_proj",
128
- "language_model.layers.21.self_attn.v_proj",
129
- "39.self_attn.k_proj",
130
- "47.self_attn.q_proj",
131
- "32.self_attn.k_proj",
132
- "43.self_attn.v_proj",
133
  "language_model.layers.2.self_attn.q_proj",
134
- "47.self_attn.v_proj",
135
- "37.self_attn.q_proj",
136
- "language_model.layers.19.self_attn.v_proj",
 
 
 
 
137
  "language_model.layers.13.self_attn.k_proj",
138
- "42.self_attn.k_proj",
139
- "language_model.layers.23.self_attn.k_proj",
 
 
 
 
 
140
  "language_model.layers.3.self_attn.q_proj",
141
- "language_model.layers.20.self_attn.v_proj",
142
- "30.self_attn.q_proj",
 
 
 
 
 
 
 
 
 
143
  "28.self_attn.k_proj",
144
- "language_model.layers.22.self_attn.k_proj",
145
- "language_model.layers.19.self_attn.q_proj",
146
- "language_model.layers.2.self_attn.k_proj",
147
- "language_model.layers.1.self_attn.k_proj",
148
  "language_model.layers.13.self_attn.q_proj",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
149
  "language_model.layers.0.self_attn.q_proj",
150
- "44.self_attn.v_proj",
151
- "up_proj",
 
 
 
 
152
  "33.self_attn.v_proj",
153
- "language_model.layers.15.self_attn.q_proj",
154
- "language_model.layers.8.self_attn.v_proj",
155
- "language_model.layers.16.self_attn.v_proj",
156
- "language_model.layers.16.self_attn.k_proj",
157
- "35.self_attn.k_proj",
158
- "42.self_attn.q_proj",
159
- "language_model.layers.1.self_attn.v_proj",
160
- "34.self_attn.k_proj",
161
- "43.self_attn.q_proj",
162
- "language_model.layers.9.self_attn.v_proj",
163
  "language_model.layers.17.self_attn.q_proj",
164
- "28.self_attn.v_proj",
 
 
 
 
 
165
  "38.self_attn.k_proj",
166
- "language_model.layers.11.self_attn.k_proj",
167
- "40.self_attn.k_proj",
 
 
 
 
 
 
168
  "language_model.layers.7.self_attn.q_proj",
169
- "gate_proj",
170
- "language_model.layers.16.self_attn.q_proj",
171
- "language_model.layers.24.self_attn.q_proj",
172
- "language_model.layers.5.self_attn.q_proj",
173
- "language_model.layers.14.self_attn.v_proj",
174
- "language_model.layers.22.self_attn.q_proj",
175
- "language_model.layers.5.self_attn.v_proj",
176
- "41.self_attn.v_proj",
 
 
 
 
 
 
 
 
 
 
 
 
177
  "35.self_attn.v_proj",
178
- "language_model.layers.11.self_attn.v_proj"
 
 
 
 
 
 
179
  ],
180
  "task_type": "CAUSAL_LM",
181
  "trainable_token_indices": null,
 
28
  "rank_pattern": {},
29
  "revision": null,
30
  "target_modules": [
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
31
  "33.self_attn.q_proj",
32
+ "up_proj",
33
+ "language_model.layers.5.self_attn.k_proj",
34
+ "language_model.layers.11.self_attn.v_proj",
35
+ "32.self_attn.k_proj",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
36
  "language_model.layers.26.self_attn.k_proj",
37
+ "38.self_attn.v_proj",
38
+ "36.self_attn.v_proj",
39
+ "39.self_attn.k_proj",
40
+ "language_model.layers.5.self_attn.q_proj",
41
+ "43.self_attn.k_proj",
42
+ "language_model.layers.16.self_attn.v_proj",
43
+ "37.self_attn.q_proj",
44
+ "language_model.layers.20.self_attn.k_proj",
 
 
45
  "language_model.layers.25.self_attn.k_proj",
46
+ "language_model.layers.0.self_attn.k_proj",
47
+ "language_model.layers.8.self_attn.q_proj",
 
 
48
  "42.self_attn.v_proj",
49
+ "38.self_attn.q_proj",
 
 
 
 
 
 
 
50
  "language_model.layers.15.self_attn.v_proj",
51
+ "language_model.layers.11.self_attn.k_proj",
52
+ "language_model.layers.21.self_attn.v_proj",
53
  "45.self_attn.k_proj",
 
 
 
 
 
 
 
54
  "34.self_attn.v_proj",
55
+ "language_model.layers.16.self_attn.q_proj",
56
+ "language_model.layers.24.self_attn.q_proj",
57
+ "language_model.layers.19.self_attn.k_proj",
58
  "34.self_attn.q_proj",
 
 
59
  "language_model.layers.2.self_attn.v_proj",
60
+ "language_model.layers.6.self_attn.v_proj",
61
+ "33.self_attn.k_proj",
62
+ "32.self_attn.v_proj",
63
+ "41.self_attn.v_proj",
64
+ "language_model.layers.14.self_attn.q_proj",
65
+ "language_model.layers.23.self_attn.k_proj",
66
+ "30.self_attn.k_proj",
67
+ "40.self_attn.k_proj",
68
  "39.self_attn.q_proj",
69
+ "language_model.layers.20.self_attn.q_proj",
70
+ "28.self_attn.v_proj",
71
+ "language_model.layers.8.self_attn.k_proj",
72
+ "language_model.layers.9.self_attn.k_proj",
73
+ "47.self_attn.k_proj",
74
+ "gate_proj",
75
  "language_model.layers.2.self_attn.q_proj",
76
+ "language_model.layers.1.self_attn.q_proj",
77
+ "language_model.layers.7.self_attn.k_proj",
78
+ "language_model.layers.5.self_attn.v_proj",
79
+ "30.self_attn.q_proj",
80
+ "language_model.layers.7.self_attn.v_proj",
81
+ "45.self_attn.v_proj",
82
+ "language_model.layers.10.self_attn.q_proj",
83
  "language_model.layers.13.self_attn.k_proj",
84
+ "43.self_attn.v_proj",
85
+ "44.self_attn.k_proj",
86
+ "43.self_attn.q_proj",
87
+ "language_model.layers.2.self_attn.k_proj",
88
+ "language_model.layers.10.self_attn.v_proj",
89
+ "language_model.layers.17.self_attn.k_proj",
90
+ "o_proj",
91
  "language_model.layers.3.self_attn.q_proj",
92
+ "44.self_attn.q_proj",
93
+ "language_model.layers.18.self_attn.k_proj",
94
+ "language_model.layers.25.self_attn.v_proj",
95
+ "45.self_attn.q_proj",
96
+ "language_model.layers.12.self_attn.q_proj",
97
+ "29.self_attn.v_proj",
98
+ "language_model.layers.18.self_attn.v_proj",
99
+ "language_model.layers.15.self_attn.q_proj",
100
+ "down_proj",
101
+ "42.self_attn.q_proj",
102
+ "language_model.layers.8.self_attn.v_proj",
103
  "28.self_attn.k_proj",
104
+ "31.self_attn.q_proj",
 
 
 
105
  "language_model.layers.13.self_attn.q_proj",
106
+ "language_model.layers.1.self_attn.v_proj",
107
+ "31.self_attn.k_proj",
108
+ "language_model.layers.20.self_attn.v_proj",
109
+ "language_model.layers.18.self_attn.q_proj",
110
+ "language_model.layers.23.self_attn.v_proj",
111
+ "language_model.layers.6.self_attn.q_proj",
112
+ "language_model.layers.10.self_attn.k_proj",
113
+ "language_model.layers.26.self_attn.v_proj",
114
+ "40.self_attn.q_proj",
115
+ "36.self_attn.k_proj",
116
+ "language_model.layers.13.self_attn.v_proj",
117
+ "language_model.layers.23.self_attn.q_proj",
118
+ "42.self_attn.k_proj",
119
+ "27.self_attn.v_proj",
120
+ "27.self_attn.k_proj",
121
+ "30.self_attn.v_proj",
122
+ "27.self_attn.q_proj",
123
  "language_model.layers.0.self_attn.q_proj",
124
+ "language_model.layers.0.self_attn.v_proj",
125
+ "31.self_attn.v_proj",
126
+ "language_model.layers.4.self_attn.v_proj",
127
+ "language_model.layers.25.self_attn.q_proj",
128
+ "language_model.layers.22.self_attn.q_proj",
129
+ "language_model.layers.12.self_attn.v_proj",
130
  "33.self_attn.v_proj",
131
+ "37.self_attn.v_proj",
132
+ "41.self_attn.k_proj",
133
+ "language_model.layers.4.self_attn.k_proj",
 
 
 
 
 
 
 
134
  "language_model.layers.17.self_attn.q_proj",
135
+ "language_model.layers.21.self_attn.q_proj",
136
+ "language_model.layers.16.self_attn.k_proj",
137
+ "language_model.layers.6.self_attn.k_proj",
138
+ "46.self_attn.k_proj",
139
+ "language_model.layers.14.self_attn.v_proj",
140
+ "40.self_attn.v_proj",
141
  "38.self_attn.k_proj",
142
+ "language_model.layers.9.self_attn.q_proj",
143
+ "language_model.layers.26.self_attn.q_proj",
144
+ "language_model.layers.24.self_attn.v_proj",
145
+ "29.self_attn.q_proj",
146
+ "41.self_attn.q_proj",
147
+ "language_model.layers.19.self_attn.v_proj",
148
+ "language_model.layers.22.self_attn.v_proj",
149
+ "language_model.layers.21.self_attn.k_proj",
150
  "language_model.layers.7.self_attn.q_proj",
151
+ "32.self_attn.q_proj",
152
+ "language_model.layers.15.self_attn.k_proj",
153
+ "language_model.layers.12.self_attn.k_proj",
154
+ "39.self_attn.v_proj",
155
+ "language_model.layers.9.self_attn.v_proj",
156
+ "35.self_attn.k_proj",
157
+ "language_model.layers.19.self_attn.q_proj",
158
+ "28.self_attn.q_proj",
159
+ "language_model.layers.14.self_attn.k_proj",
160
+ "language_model.layers.3.self_attn.k_proj",
161
+ "language_model.layers.1.self_attn.k_proj",
162
+ "37.self_attn.k_proj",
163
+ "34.self_attn.k_proj",
164
+ "language_model.layers.3.self_attn.v_proj",
165
+ "36.self_attn.q_proj",
166
+ "47.self_attn.v_proj",
167
+ "44.self_attn.v_proj",
168
+ "29.self_attn.k_proj",
169
+ "46.self_attn.q_proj",
170
+ "46.self_attn.v_proj",
171
  "35.self_attn.v_proj",
172
+ "language_model.layers.22.self_attn.k_proj",
173
+ "language_model.layers.11.self_attn.q_proj",
174
+ "language_model.layers.4.self_attn.q_proj",
175
+ "35.self_attn.q_proj",
176
+ "47.self_attn.q_proj",
177
+ "language_model.layers.24.self_attn.k_proj",
178
+ "language_model.layers.17.self_attn.v_proj"
179
  ],
180
  "task_type": "CAUSAL_LM",
181
  "trainable_token_indices": null,
checkpoint-1000/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1a98dbf0225d0bdfaad0af249d68fad53159cddecf45b2ddc7f14abd4b0e7ba1
3
  size 131040264
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:180f54d28b5633f2269d9231c9d0b21f0454ad53695a3c019752f918b17a014f
3
  size 131040264
checkpoint-1000/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:44afa3b8223494f0737e6042f4e5222962ba0beafa93e8dbf149e6956c0c1ee6
3
- size 3449
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:33d232d1cac1e7edb014c27ff65c23267d600276726497e1f0e99842835ec818
3
+ size 262448707
checkpoint-1000/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9a342b0a98c4a7f4d98d7b17d47eaf35d72d591aeb6847e05f9152644dc05f83
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5ccd010e73e458407adaebd742d06d98855c8b6ddd52c61099f6bbc2c2481526
3
  size 1465
checkpoint-1000/special_tokens_map.json CHANGED
@@ -9,7 +9,7 @@
9
  },
10
  "eoi_token": "<end_of_image>",
11
  "eos_token": {
12
- "content": "<eos>",
13
  "lstrip": false,
14
  "normalized": false,
15
  "rstrip": false,
 
9
  },
10
  "eoi_token": "<end_of_image>",
11
  "eos_token": {
12
+ "content": "<end_of_turn>",
13
  "lstrip": false,
14
  "normalized": false,
15
  "rstrip": false,
checkpoint-1000/tokenizer_config.json CHANGED
@@ -51327,7 +51327,7 @@
51327
  "bos_token": "<bos>",
51328
  "clean_up_tokenization_spaces": false,
51329
  "eoi_token": "<end_of_image>",
51330
- "eos_token": "<eos>",
51331
  "extra_special_tokens": {
51332
  "boi_token": "<start_of_image>",
51333
  "eoi_token": "<end_of_image>",
 
51327
  "bos_token": "<bos>",
51328
  "clean_up_tokenization_spaces": false,
51329
  "eoi_token": "<end_of_image>",
51330
+ "eos_token": "<end_of_turn>",
51331
  "extra_special_tokens": {
51332
  "boi_token": "<start_of_image>",
51333
  "eoi_token": "<end_of_image>",
checkpoint-1000/trainer_state.json CHANGED
@@ -11,1008 +11,1008 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.021528525296017224,
14
- "grad_norm": NaN,
15
- "learning_rate": 3e-05,
16
- "loss": 0.0,
17
- "num_input_tokens_seen": 26560,
18
  "step": 10,
19
- "train_runtime": 72.1053,
20
- "train_tokens_per_second": 368.35
21
  },
22
  {
23
  "epoch": 0.04305705059203445,
24
- "grad_norm": NaN,
25
- "learning_rate": 3e-05,
26
- "loss": 0.0,
27
- "num_input_tokens_seen": 52672,
28
  "step": 20,
29
- "train_runtime": 93.4817,
30
- "train_tokens_per_second": 563.447
31
  },
32
  {
33
  "epoch": 0.06458557588805167,
34
- "grad_norm": NaN,
35
- "learning_rate": 3e-05,
36
- "loss": 0.0,
37
- "num_input_tokens_seen": 79360,
38
  "step": 30,
39
- "train_runtime": 115.1034,
40
- "train_tokens_per_second": 689.467
41
  },
42
  {
43
  "epoch": 0.0861141011840689,
44
- "grad_norm": NaN,
45
- "learning_rate": 3e-05,
46
- "loss": 0.0,
47
- "num_input_tokens_seen": 106432,
48
  "step": 40,
49
- "train_runtime": 136.9811,
50
- "train_tokens_per_second": 776.983
51
  },
52
  {
53
  "epoch": 0.10764262648008611,
54
- "grad_norm": NaN,
55
- "learning_rate": 3e-05,
56
- "loss": 0.0,
57
- "num_input_tokens_seen": 132992,
58
  "step": 50,
59
- "train_runtime": 158.4451,
60
- "train_tokens_per_second": 839.357
61
  },
62
  {
63
  "epoch": 0.12917115177610333,
64
- "grad_norm": NaN,
65
- "learning_rate": 3e-05,
66
- "loss": 0.0,
67
- "num_input_tokens_seen": 159936,
68
  "step": 60,
69
- "train_runtime": 180.1478,
70
- "train_tokens_per_second": 887.804
71
  },
72
  {
73
  "epoch": 0.15069967707212056,
74
- "grad_norm": NaN,
75
- "learning_rate": 3e-05,
76
- "loss": 0.0,
77
- "num_input_tokens_seen": 186624,
78
  "step": 70,
79
- "train_runtime": 201.6103,
80
- "train_tokens_per_second": 925.667
81
  },
82
  {
83
  "epoch": 0.1722282023681378,
84
- "grad_norm": NaN,
85
- "learning_rate": 3e-05,
86
- "loss": 0.0,
87
- "num_input_tokens_seen": 213216,
88
  "step": 80,
89
- "train_runtime": 223.2507,
90
- "train_tokens_per_second": 955.052
91
  },
92
  {
93
  "epoch": 0.193756727664155,
94
- "grad_norm": NaN,
95
- "learning_rate": 3e-05,
96
- "loss": 0.0,
97
- "num_input_tokens_seen": 239328,
98
  "step": 90,
99
- "train_runtime": 244.8417,
100
- "train_tokens_per_second": 977.481
101
  },
102
  {
103
  "epoch": 0.21528525296017223,
104
- "grad_norm": NaN,
105
- "learning_rate": 3e-05,
106
- "loss": 0.0,
107
- "num_input_tokens_seen": 265920,
108
  "step": 100,
109
- "train_runtime": 266.376,
110
- "train_tokens_per_second": 998.288
111
  },
112
  {
113
  "epoch": 0.23681377825618946,
114
- "grad_norm": NaN,
115
- "learning_rate": 3e-05,
116
- "loss": 0.0,
117
- "num_input_tokens_seen": 292288,
118
  "step": 110,
119
- "train_runtime": 287.9016,
120
- "train_tokens_per_second": 1015.236
121
  },
122
  {
123
  "epoch": 0.25834230355220666,
124
- "grad_norm": NaN,
125
- "learning_rate": 3e-05,
126
- "loss": 0.0,
127
- "num_input_tokens_seen": 319264,
128
  "step": 120,
129
- "train_runtime": 309.7609,
130
- "train_tokens_per_second": 1030.679
131
  },
132
  {
133
  "epoch": 0.2798708288482239,
134
- "grad_norm": NaN,
135
- "learning_rate": 3e-05,
136
- "loss": 0.0,
137
- "num_input_tokens_seen": 346144,
138
  "step": 130,
139
- "train_runtime": 331.4402,
140
- "train_tokens_per_second": 1044.363
141
  },
142
  {
143
  "epoch": 0.3013993541442411,
144
- "grad_norm": NaN,
145
- "learning_rate": 3e-05,
146
- "loss": 0.0,
147
- "num_input_tokens_seen": 372800,
148
  "step": 140,
149
- "train_runtime": 353.0058,
150
- "train_tokens_per_second": 1056.073
151
  },
152
  {
153
  "epoch": 0.32292787944025836,
154
- "grad_norm": NaN,
155
- "learning_rate": 3e-05,
156
- "loss": 0.0,
157
- "num_input_tokens_seen": 399552,
158
  "step": 150,
159
- "train_runtime": 374.6224,
160
- "train_tokens_per_second": 1066.546
161
  },
162
  {
163
  "epoch": 0.3444564047362756,
164
- "grad_norm": NaN,
165
- "learning_rate": 3e-05,
166
- "loss": 0.0,
167
- "num_input_tokens_seen": 426464,
168
  "step": 160,
169
- "train_runtime": 396.271,
170
- "train_tokens_per_second": 1076.193
171
  },
172
  {
173
  "epoch": 0.36598493003229277,
174
- "grad_norm": NaN,
175
- "learning_rate": 3e-05,
176
- "loss": 0.0,
177
- "num_input_tokens_seen": 452672,
178
  "step": 170,
179
- "train_runtime": 417.6737,
180
- "train_tokens_per_second": 1083.793
181
  },
182
  {
183
  "epoch": 0.38751345532831,
184
- "grad_norm": NaN,
185
- "learning_rate": 3e-05,
186
- "loss": 0.0,
187
- "num_input_tokens_seen": 479136,
188
  "step": 180,
189
- "train_runtime": 439.2321,
190
- "train_tokens_per_second": 1090.849
191
  },
192
  {
193
  "epoch": 0.40904198062432723,
194
- "grad_norm": NaN,
195
- "learning_rate": 3e-05,
196
- "loss": 0.0,
197
- "num_input_tokens_seen": 505728,
198
  "step": 190,
199
- "train_runtime": 460.7964,
200
- "train_tokens_per_second": 1097.508
201
  },
202
  {
203
  "epoch": 0.43057050592034446,
204
- "grad_norm": NaN,
205
- "learning_rate": 3e-05,
206
- "loss": 0.0,
207
- "num_input_tokens_seen": 532576,
208
  "step": 200,
209
- "train_runtime": 482.3668,
210
- "train_tokens_per_second": 1104.089
211
  },
212
  {
213
  "epoch": 0.4520990312163617,
214
- "grad_norm": NaN,
215
- "learning_rate": 3e-05,
216
- "loss": 0.0,
217
- "num_input_tokens_seen": 559168,
218
  "step": 210,
219
- "train_runtime": 503.9477,
220
- "train_tokens_per_second": 1109.575
221
  },
222
  {
223
  "epoch": 0.4736275565123789,
224
- "grad_norm": NaN,
225
- "learning_rate": 3e-05,
226
- "loss": 0.0,
227
- "num_input_tokens_seen": 586144,
228
  "step": 220,
229
- "train_runtime": 525.6286,
230
- "train_tokens_per_second": 1115.13
231
  },
232
  {
233
  "epoch": 0.4951560818083961,
234
- "grad_norm": NaN,
235
- "learning_rate": 3e-05,
236
- "loss": 0.0,
237
- "num_input_tokens_seen": 612416,
238
  "step": 230,
239
- "train_runtime": 547.0447,
240
- "train_tokens_per_second": 1119.499
241
  },
242
  {
243
  "epoch": 0.5166846071044133,
244
- "grad_norm": NaN,
245
- "learning_rate": 3e-05,
246
- "loss": 0.0,
247
- "num_input_tokens_seen": 639584,
248
  "step": 240,
249
- "train_runtime": 568.7823,
250
- "train_tokens_per_second": 1124.479
251
  },
252
  {
253
  "epoch": 0.5382131324004306,
254
- "grad_norm": NaN,
255
- "learning_rate": 3e-05,
256
- "loss": 0.0,
257
- "num_input_tokens_seen": 665952,
258
  "step": 250,
259
- "train_runtime": 590.0539,
260
- "train_tokens_per_second": 1128.629
261
  },
262
  {
263
  "epoch": 0.5597416576964478,
264
- "grad_norm": NaN,
265
- "learning_rate": 3e-05,
266
- "loss": 0.0,
267
- "num_input_tokens_seen": 693440,
268
  "step": 260,
269
- "train_runtime": 611.9275,
270
- "train_tokens_per_second": 1133.206
271
  },
272
  {
273
  "epoch": 0.581270182992465,
274
- "grad_norm": NaN,
275
- "learning_rate": 3e-05,
276
- "loss": 0.0,
277
- "num_input_tokens_seen": 720128,
278
  "step": 270,
279
- "train_runtime": 633.5076,
280
- "train_tokens_per_second": 1136.731
281
  },
282
  {
283
  "epoch": 0.6027987082884823,
284
- "grad_norm": NaN,
285
- "learning_rate": 3e-05,
286
- "loss": 0.0,
287
- "num_input_tokens_seen": 747360,
288
  "step": 280,
289
- "train_runtime": 655.28,
290
- "train_tokens_per_second": 1140.52
291
  },
292
  {
293
  "epoch": 0.6243272335844995,
294
- "grad_norm": NaN,
295
- "learning_rate": 3e-05,
296
- "loss": 0.0,
297
- "num_input_tokens_seen": 774752,
298
  "step": 290,
299
- "train_runtime": 676.9385,
300
- "train_tokens_per_second": 1144.494
301
  },
302
  {
303
  "epoch": 0.6458557588805167,
304
- "grad_norm": NaN,
305
- "learning_rate": 3e-05,
306
- "loss": 0.0,
307
- "num_input_tokens_seen": 801216,
308
  "step": 300,
309
- "train_runtime": 698.3174,
310
- "train_tokens_per_second": 1147.352
311
  },
312
  {
313
  "epoch": 0.667384284176534,
314
- "grad_norm": NaN,
315
- "learning_rate": 3e-05,
316
- "loss": 0.0,
317
- "num_input_tokens_seen": 827552,
318
  "step": 310,
319
- "train_runtime": 719.7081,
320
- "train_tokens_per_second": 1149.844
321
  },
322
  {
323
  "epoch": 0.6889128094725512,
324
- "grad_norm": NaN,
325
- "learning_rate": 3e-05,
326
- "loss": 0.0,
327
- "num_input_tokens_seen": 854304,
328
  "step": 320,
329
- "train_runtime": 741.3129,
330
- "train_tokens_per_second": 1152.42
331
  },
332
  {
333
  "epoch": 0.7104413347685683,
334
- "grad_norm": NaN,
335
- "learning_rate": 3e-05,
336
- "loss": 0.0,
337
- "num_input_tokens_seen": 881344,
338
  "step": 330,
339
- "train_runtime": 762.9651,
340
- "train_tokens_per_second": 1155.156
341
  },
342
  {
343
  "epoch": 0.7319698600645855,
344
- "grad_norm": NaN,
345
- "learning_rate": 3e-05,
346
- "loss": 0.0,
347
- "num_input_tokens_seen": 907872,
348
  "step": 340,
349
- "train_runtime": 784.4227,
350
- "train_tokens_per_second": 1157.376
351
  },
352
  {
353
  "epoch": 0.7534983853606028,
354
- "grad_norm": NaN,
355
- "learning_rate": 3e-05,
356
- "loss": 0.0,
357
- "num_input_tokens_seen": 935968,
358
  "step": 350,
359
- "train_runtime": 806.8701,
360
- "train_tokens_per_second": 1159.998
361
  },
362
  {
363
  "epoch": 0.77502691065662,
364
- "grad_norm": NaN,
365
- "learning_rate": 3e-05,
366
- "loss": 0.0,
367
- "num_input_tokens_seen": 962816,
368
  "step": 360,
369
- "train_runtime": 828.4786,
370
- "train_tokens_per_second": 1162.15
371
  },
372
  {
373
  "epoch": 0.7965554359526372,
374
- "grad_norm": NaN,
375
- "learning_rate": 3e-05,
376
- "loss": 0.0,
377
- "num_input_tokens_seen": 990848,
378
  "step": 370,
379
- "train_runtime": 850.6384,
380
- "train_tokens_per_second": 1164.829
381
  },
382
  {
383
  "epoch": 0.8180839612486545,
384
- "grad_norm": NaN,
385
- "learning_rate": 3e-05,
386
- "loss": 0.0,
387
- "num_input_tokens_seen": 1017632,
388
  "step": 380,
389
- "train_runtime": 872.1711,
390
- "train_tokens_per_second": 1166.78
391
  },
392
  {
393
  "epoch": 0.8396124865446717,
394
- "grad_norm": NaN,
395
- "learning_rate": 3e-05,
396
- "loss": 0.0,
397
- "num_input_tokens_seen": 1044000,
398
  "step": 390,
399
- "train_runtime": 893.5948,
400
- "train_tokens_per_second": 1168.315
401
  },
402
  {
403
  "epoch": 0.8611410118406889,
404
- "grad_norm": NaN,
405
- "learning_rate": 3e-05,
406
- "loss": 0.0,
407
- "num_input_tokens_seen": 1070240,
408
  "step": 400,
409
- "train_runtime": 914.9469,
410
- "train_tokens_per_second": 1169.729
411
  },
412
  {
413
  "epoch": 0.8826695371367062,
414
- "grad_norm": NaN,
415
- "learning_rate": 3e-05,
416
- "loss": 0.0,
417
- "num_input_tokens_seen": 1097056,
418
  "step": 410,
419
- "train_runtime": 936.5773,
420
- "train_tokens_per_second": 1171.346
421
  },
422
  {
423
  "epoch": 0.9041980624327234,
424
- "grad_norm": NaN,
425
- "learning_rate": 3e-05,
426
- "loss": 0.0,
427
- "num_input_tokens_seen": 1123744,
428
  "step": 420,
429
- "train_runtime": 958.1608,
430
- "train_tokens_per_second": 1172.814
431
  },
432
  {
433
  "epoch": 0.9257265877287406,
434
- "grad_norm": NaN,
435
- "learning_rate": 3e-05,
436
- "loss": 0.0,
437
- "num_input_tokens_seen": 1150432,
438
  "step": 430,
439
- "train_runtime": 979.8442,
440
- "train_tokens_per_second": 1174.097
441
  },
442
  {
443
  "epoch": 0.9472551130247578,
444
- "grad_norm": NaN,
445
- "learning_rate": 3e-05,
446
- "loss": 0.0,
447
- "num_input_tokens_seen": 1175840,
448
  "step": 440,
449
- "train_runtime": 1000.9839,
450
- "train_tokens_per_second": 1174.684
451
  },
452
  {
453
  "epoch": 0.9687836383207751,
454
- "grad_norm": NaN,
455
- "learning_rate": 3e-05,
456
- "loss": 0.0,
457
- "num_input_tokens_seen": 1202496,
458
  "step": 450,
459
- "train_runtime": 1022.4292,
460
- "train_tokens_per_second": 1176.117
461
  },
462
  {
463
  "epoch": 0.9903121636167922,
464
- "grad_norm": NaN,
465
- "learning_rate": 3e-05,
466
- "loss": 0.0,
467
- "num_input_tokens_seen": 1228896,
468
  "step": 460,
469
- "train_runtime": 1043.8998,
470
- "train_tokens_per_second": 1177.216
471
  },
472
  {
473
  "epoch": 1.0107642626480087,
474
- "grad_norm": NaN,
475
- "learning_rate": 3e-05,
476
- "loss": 0.0,
477
- "num_input_tokens_seen": 1254560,
478
  "step": 470,
479
- "train_runtime": 1064.5717,
480
- "train_tokens_per_second": 1178.465
481
  },
482
  {
483
  "epoch": 1.0322927879440258,
484
- "grad_norm": NaN,
485
- "learning_rate": 3e-05,
486
- "loss": 0.0,
487
- "num_input_tokens_seen": 1281024,
488
  "step": 480,
489
- "train_runtime": 1086.0046,
490
- "train_tokens_per_second": 1179.575
491
  },
492
  {
493
  "epoch": 1.0538213132400431,
494
- "grad_norm": NaN,
495
- "learning_rate": 3e-05,
496
- "loss": 0.0,
497
- "num_input_tokens_seen": 1308032,
498
  "step": 490,
499
- "train_runtime": 1108.0344,
500
- "train_tokens_per_second": 1180.498
501
  },
502
  {
503
  "epoch": 1.0753498385360603,
504
- "grad_norm": NaN,
505
- "learning_rate": 3e-05,
506
- "loss": 0.0,
507
- "num_input_tokens_seen": 1335328,
508
  "step": 500,
509
- "train_runtime": 1129.7981,
510
- "train_tokens_per_second": 1181.917
511
  },
512
  {
513
  "epoch": 1.0968783638320776,
514
- "grad_norm": NaN,
515
- "learning_rate": 3e-05,
516
- "loss": 0.0,
517
- "num_input_tokens_seen": 1361888,
518
  "step": 510,
519
- "train_runtime": 1151.3927,
520
- "train_tokens_per_second": 1182.818
521
  },
522
  {
523
  "epoch": 1.1184068891280947,
524
- "grad_norm": NaN,
525
- "learning_rate": 3e-05,
526
- "loss": 0.0,
527
- "num_input_tokens_seen": 1388768,
528
  "step": 520,
529
- "train_runtime": 1173.0032,
530
- "train_tokens_per_second": 1183.942
531
  },
532
  {
533
  "epoch": 1.1399354144241118,
534
- "grad_norm": NaN,
535
- "learning_rate": 3e-05,
536
- "loss": 0.0,
537
- "num_input_tokens_seen": 1414912,
538
  "step": 530,
539
- "train_runtime": 1194.4547,
540
- "train_tokens_per_second": 1184.567
541
  },
542
  {
543
  "epoch": 1.1614639397201292,
544
- "grad_norm": NaN,
545
- "learning_rate": 3e-05,
546
- "loss": 0.0,
547
- "num_input_tokens_seen": 1441440,
548
  "step": 540,
549
- "train_runtime": 1215.9057,
550
- "train_tokens_per_second": 1185.487
551
  },
552
  {
553
  "epoch": 1.1829924650161463,
554
- "grad_norm": NaN,
555
- "learning_rate": 3e-05,
556
- "loss": 0.0,
557
- "num_input_tokens_seen": 1468864,
558
  "step": 550,
559
- "train_runtime": 1237.9092,
560
- "train_tokens_per_second": 1186.568
561
  },
562
  {
563
  "epoch": 1.2045209903121636,
564
- "grad_norm": NaN,
565
- "learning_rate": 3e-05,
566
- "loss": 0.0,
567
- "num_input_tokens_seen": 1495616,
568
  "step": 560,
569
- "train_runtime": 1259.4077,
570
- "train_tokens_per_second": 1187.555
571
  },
572
  {
573
  "epoch": 1.2260495156081808,
574
- "grad_norm": NaN,
575
- "learning_rate": 3e-05,
576
- "loss": 0.0,
577
- "num_input_tokens_seen": 1521856,
578
  "step": 570,
579
- "train_runtime": 1280.8048,
580
- "train_tokens_per_second": 1188.203
581
  },
582
  {
583
  "epoch": 1.247578040904198,
584
- "grad_norm": NaN,
585
- "learning_rate": 3e-05,
586
- "loss": 0.0,
587
- "num_input_tokens_seen": 1548640,
588
  "step": 580,
589
- "train_runtime": 1302.2946,
590
- "train_tokens_per_second": 1189.163
591
  },
592
  {
593
  "epoch": 1.2691065662002152,
594
- "grad_norm": NaN,
595
- "learning_rate": 3e-05,
596
- "loss": 0.0,
597
- "num_input_tokens_seen": 1575040,
598
  "step": 590,
599
- "train_runtime": 1323.6781,
600
- "train_tokens_per_second": 1189.897
601
  },
602
  {
603
  "epoch": 1.2906350914962326,
604
- "grad_norm": NaN,
605
- "learning_rate": 3e-05,
606
- "loss": 0.0,
607
- "num_input_tokens_seen": 1601280,
608
  "step": 600,
609
- "train_runtime": 1345.6098,
610
- "train_tokens_per_second": 1190.003
611
  },
612
  {
613
  "epoch": 1.3121636167922497,
614
- "grad_norm": NaN,
615
- "learning_rate": 3e-05,
616
- "loss": 0.0,
617
- "num_input_tokens_seen": 1628416,
618
  "step": 610,
619
- "train_runtime": 1367.3052,
620
- "train_tokens_per_second": 1190.967
621
  },
622
  {
623
  "epoch": 1.333692142088267,
624
- "grad_norm": NaN,
625
- "learning_rate": 3e-05,
626
- "loss": 0.0,
627
- "num_input_tokens_seen": 1654400,
628
  "step": 620,
629
- "train_runtime": 1388.5516,
630
- "train_tokens_per_second": 1191.457
631
  },
632
  {
633
  "epoch": 1.3552206673842842,
634
- "grad_norm": NaN,
635
- "learning_rate": 3e-05,
636
- "loss": 0.0,
637
- "num_input_tokens_seen": 1681632,
638
  "step": 630,
639
- "train_runtime": 1410.3043,
640
- "train_tokens_per_second": 1192.389
641
  },
642
  {
643
  "epoch": 1.3767491926803013,
644
- "grad_norm": NaN,
645
- "learning_rate": 3e-05,
646
- "loss": 0.0,
647
- "num_input_tokens_seen": 1708480,
648
  "step": 640,
649
- "train_runtime": 1431.8604,
650
- "train_tokens_per_second": 1193.189
651
  },
652
  {
653
  "epoch": 1.3982777179763186,
654
- "grad_norm": NaN,
655
- "learning_rate": 3e-05,
656
- "loss": 0.0,
657
- "num_input_tokens_seen": 1734816,
658
  "step": 650,
659
- "train_runtime": 1453.3567,
660
- "train_tokens_per_second": 1193.662
661
  },
662
  {
663
  "epoch": 1.419806243272336,
664
- "grad_norm": NaN,
665
- "learning_rate": 3e-05,
666
- "loss": 0.0,
667
- "num_input_tokens_seen": 1761248,
668
  "step": 660,
669
- "train_runtime": 1474.9227,
670
- "train_tokens_per_second": 1194.129
671
  },
672
  {
673
  "epoch": 1.441334768568353,
674
- "grad_norm": NaN,
675
- "learning_rate": 3e-05,
676
- "loss": 0.0,
677
- "num_input_tokens_seen": 1788064,
678
  "step": 670,
679
- "train_runtime": 1496.4738,
680
- "train_tokens_per_second": 1194.852
681
  },
682
  {
683
  "epoch": 1.4628632938643702,
684
- "grad_norm": NaN,
685
- "learning_rate": 3e-05,
686
- "loss": 0.0,
687
- "num_input_tokens_seen": 1815360,
688
  "step": 680,
689
- "train_runtime": 1518.1973,
690
- "train_tokens_per_second": 1195.734
691
  },
692
  {
693
  "epoch": 1.4843918191603875,
694
- "grad_norm": NaN,
695
- "learning_rate": 3e-05,
696
- "loss": 0.0,
697
- "num_input_tokens_seen": 1842112,
698
  "step": 690,
699
- "train_runtime": 1539.7277,
700
- "train_tokens_per_second": 1196.388
701
  },
702
  {
703
  "epoch": 1.5059203444564049,
704
- "grad_norm": NaN,
705
- "learning_rate": 3e-05,
706
- "loss": 0.0,
707
- "num_input_tokens_seen": 1868576,
708
  "step": 700,
709
- "train_runtime": 1561.4391,
710
- "train_tokens_per_second": 1196.701
711
  },
712
  {
713
  "epoch": 1.527448869752422,
714
- "grad_norm": NaN,
715
- "learning_rate": 3e-05,
716
- "loss": 0.0,
717
- "num_input_tokens_seen": 1895360,
718
  "step": 710,
719
- "train_runtime": 1583.0746,
720
- "train_tokens_per_second": 1197.265
721
  },
722
  {
723
  "epoch": 1.5489773950484391,
724
- "grad_norm": NaN,
725
- "learning_rate": 3e-05,
726
- "loss": 0.0,
727
- "num_input_tokens_seen": 1922272,
728
  "step": 720,
729
- "train_runtime": 1604.6761,
730
- "train_tokens_per_second": 1197.919
731
  },
732
  {
733
  "epoch": 1.5705059203444565,
734
- "grad_norm": NaN,
735
- "learning_rate": 3e-05,
736
- "loss": 0.0,
737
- "num_input_tokens_seen": 1947936,
738
  "step": 730,
739
- "train_runtime": 1625.9061,
740
- "train_tokens_per_second": 1198.062
741
  },
742
  {
743
  "epoch": 1.5920344456404736,
744
- "grad_norm": NaN,
745
- "learning_rate": 3e-05,
746
- "loss": 0.0,
747
- "num_input_tokens_seen": 1974528,
748
  "step": 740,
749
- "train_runtime": 1647.4063,
750
- "train_tokens_per_second": 1198.568
751
  },
752
  {
753
  "epoch": 1.6135629709364907,
754
- "grad_norm": NaN,
755
- "learning_rate": 3e-05,
756
- "loss": 0.0,
757
- "num_input_tokens_seen": 2001376,
758
  "step": 750,
759
- "train_runtime": 1669.1387,
760
- "train_tokens_per_second": 1199.047
761
  },
762
  {
763
  "epoch": 1.635091496232508,
764
- "grad_norm": NaN,
765
- "learning_rate": 3e-05,
766
- "loss": 0.0,
767
- "num_input_tokens_seen": 2027552,
768
  "step": 760,
769
- "train_runtime": 1690.5608,
770
- "train_tokens_per_second": 1199.337
771
  },
772
  {
773
  "epoch": 1.6566200215285254,
774
- "grad_norm": NaN,
775
- "learning_rate": 3e-05,
776
- "loss": 0.0,
777
- "num_input_tokens_seen": 2054592,
778
  "step": 770,
779
- "train_runtime": 1712.235,
780
- "train_tokens_per_second": 1199.947
781
  },
782
  {
783
  "epoch": 1.6781485468245425,
784
- "grad_norm": NaN,
785
- "learning_rate": 3e-05,
786
- "loss": 0.0,
787
- "num_input_tokens_seen": 2082080,
788
  "step": 780,
789
- "train_runtime": 1734.0681,
790
- "train_tokens_per_second": 1200.691
791
  },
792
  {
793
  "epoch": 1.6996770721205596,
794
- "grad_norm": NaN,
795
- "learning_rate": 3e-05,
796
- "loss": 0.0,
797
- "num_input_tokens_seen": 2107424,
798
  "step": 790,
799
- "train_runtime": 1755.0443,
800
- "train_tokens_per_second": 1200.781
801
  },
802
  {
803
  "epoch": 1.721205597416577,
804
- "grad_norm": NaN,
805
- "learning_rate": 3e-05,
806
- "loss": 0.0,
807
- "num_input_tokens_seen": 2134176,
808
  "step": 800,
809
- "train_runtime": 1776.5164,
810
- "train_tokens_per_second": 1201.326
811
  },
812
  {
813
  "epoch": 1.7427341227125943,
814
- "grad_norm": NaN,
815
- "learning_rate": 3e-05,
816
- "loss": 0.0,
817
- "num_input_tokens_seen": 2161056,
818
  "step": 810,
819
- "train_runtime": 1798.1568,
820
- "train_tokens_per_second": 1201.817
821
  },
822
  {
823
  "epoch": 1.7642626480086114,
824
- "grad_norm": NaN,
825
- "learning_rate": 3e-05,
826
- "loss": 0.0,
827
- "num_input_tokens_seen": 2188064,
828
  "step": 820,
829
- "train_runtime": 1819.7877,
830
- "train_tokens_per_second": 1202.373
831
  },
832
  {
833
  "epoch": 1.7857911733046286,
834
- "grad_norm": NaN,
835
- "learning_rate": 3e-05,
836
- "loss": 0.0,
837
- "num_input_tokens_seen": 2214816,
838
  "step": 830,
839
- "train_runtime": 1841.4354,
840
- "train_tokens_per_second": 1202.766
841
  },
842
  {
843
  "epoch": 1.807319698600646,
844
- "grad_norm": NaN,
845
- "learning_rate": 3e-05,
846
- "loss": 0.0,
847
- "num_input_tokens_seen": 2241984,
848
  "step": 840,
849
- "train_runtime": 1863.1657,
850
- "train_tokens_per_second": 1203.32
851
  },
852
  {
853
  "epoch": 1.8288482238966632,
854
- "grad_norm": NaN,
855
- "learning_rate": 3e-05,
856
- "loss": 0.0,
857
- "num_input_tokens_seen": 2268480,
858
  "step": 850,
859
- "train_runtime": 1884.6464,
860
- "train_tokens_per_second": 1203.663
861
  },
862
  {
863
  "epoch": 1.8503767491926801,
864
- "grad_norm": NaN,
865
- "learning_rate": 3e-05,
866
- "loss": 0.0,
867
- "num_input_tokens_seen": 2295648,
868
  "step": 860,
869
- "train_runtime": 1906.4991,
870
- "train_tokens_per_second": 1204.117
871
  },
872
  {
873
  "epoch": 1.8719052744886975,
874
- "grad_norm": NaN,
875
- "learning_rate": 3e-05,
876
- "loss": 0.0,
877
- "num_input_tokens_seen": 2322752,
878
  "step": 870,
879
- "train_runtime": 1928.2464,
880
- "train_tokens_per_second": 1204.593
881
  },
882
  {
883
  "epoch": 1.8934337997847148,
884
- "grad_norm": NaN,
885
- "learning_rate": 3e-05,
886
- "loss": 0.0,
887
- "num_input_tokens_seen": 2349440,
888
  "step": 880,
889
- "train_runtime": 1949.8363,
890
- "train_tokens_per_second": 1204.942
891
  },
892
  {
893
  "epoch": 1.914962325080732,
894
- "grad_norm": NaN,
895
- "learning_rate": 3e-05,
896
- "loss": 0.0,
897
- "num_input_tokens_seen": 2375744,
898
  "step": 890,
899
- "train_runtime": 1971.2562,
900
- "train_tokens_per_second": 1205.193
901
  },
902
  {
903
  "epoch": 1.936490850376749,
904
- "grad_norm": NaN,
905
- "learning_rate": 3e-05,
906
- "loss": 0.0,
907
- "num_input_tokens_seen": 2401952,
908
  "step": 900,
909
- "train_runtime": 1992.6749,
910
- "train_tokens_per_second": 1205.391
911
  },
912
  {
913
  "epoch": 1.9580193756727664,
914
- "grad_norm": NaN,
915
- "learning_rate": 3e-05,
916
- "loss": 0.0,
917
- "num_input_tokens_seen": 2428384,
918
  "step": 910,
919
- "train_runtime": 2014.3916,
920
- "train_tokens_per_second": 1205.517
921
  },
922
  {
923
  "epoch": 1.9795479009687837,
924
- "grad_norm": NaN,
925
- "learning_rate": 3e-05,
926
- "loss": 0.0,
927
- "num_input_tokens_seen": 2455040,
928
  "step": 920,
929
- "train_runtime": 2036.2422,
930
- "train_tokens_per_second": 1205.672
931
  },
932
  {
933
  "epoch": 2.0,
934
- "grad_norm": NaN,
935
- "learning_rate": 3e-05,
936
- "loss": 0.0,
937
- "num_input_tokens_seen": 2480832,
938
  "step": 930,
939
- "train_runtime": 2057.1,
940
- "train_tokens_per_second": 1205.985
941
  },
942
  {
943
  "epoch": 2.0215285252960173,
944
- "grad_norm": NaN,
945
- "learning_rate": 3e-05,
946
- "loss": 0.0,
947
- "num_input_tokens_seen": 2507296,
948
  "step": 940,
949
- "train_runtime": 2078.6644,
950
- "train_tokens_per_second": 1206.205
951
  },
952
  {
953
  "epoch": 2.0430570505920342,
954
- "grad_norm": NaN,
955
- "learning_rate": 3e-05,
956
- "loss": 0.0,
957
- "num_input_tokens_seen": 2534048,
958
  "step": 950,
959
- "train_runtime": 2100.3618,
960
- "train_tokens_per_second": 1206.482
961
  },
962
  {
963
  "epoch": 2.0645855758880516,
964
- "grad_norm": NaN,
965
- "learning_rate": 3e-05,
966
- "loss": 0.0,
967
- "num_input_tokens_seen": 2560672,
968
  "step": 960,
969
- "train_runtime": 2121.8682,
970
- "train_tokens_per_second": 1206.801
971
  },
972
  {
973
  "epoch": 2.086114101184069,
974
- "grad_norm": NaN,
975
- "learning_rate": 3e-05,
976
- "loss": 0.0,
977
- "num_input_tokens_seen": 2587520,
978
  "step": 970,
979
- "train_runtime": 2143.5225,
980
- "train_tokens_per_second": 1207.135
981
  },
982
  {
983
  "epoch": 2.1076426264800863,
984
- "grad_norm": NaN,
985
- "learning_rate": 3e-05,
986
- "loss": 0.0,
987
- "num_input_tokens_seen": 2614624,
988
  "step": 980,
989
- "train_runtime": 2165.3081,
990
- "train_tokens_per_second": 1207.507
991
  },
992
  {
993
  "epoch": 2.129171151776103,
994
- "grad_norm": NaN,
995
- "learning_rate": 3e-05,
996
- "loss": 0.0,
997
- "num_input_tokens_seen": 2641056,
998
  "step": 990,
999
- "train_runtime": 2186.8029,
1000
- "train_tokens_per_second": 1207.725
1001
  },
1002
  {
1003
  "epoch": 2.1506996770721205,
1004
- "grad_norm": NaN,
1005
- "learning_rate": 3e-05,
1006
- "loss": 0.0,
1007
- "num_input_tokens_seen": 2668128,
1008
  "step": 1000,
1009
- "train_runtime": 2208.4802,
1010
- "train_tokens_per_second": 1208.129
1011
  }
1012
  ],
1013
  "logging_steps": 10,
1014
  "max_steps": 1395,
1015
- "num_input_tokens_seen": 2668128,
1016
  "num_train_epochs": 3,
1017
  "save_steps": 1000,
1018
  "stateful_callbacks": {
@@ -1027,7 +1027,7 @@
1027
  "attributes": {}
1028
  }
1029
  },
1030
- "total_flos": 1.7943368316323328e+17,
1031
  "train_batch_size": 4,
1032
  "trial_name": null,
1033
  "trial_params": null
 
11
  "log_history": [
12
  {
13
  "epoch": 0.021528525296017224,
14
+ "grad_norm": 16.47992515563965,
15
+ "learning_rate": 9.998973021172564e-06,
16
+ "loss": 1.7834,
17
+ "num_input_tokens_seen": 43648,
18
  "step": 10,
19
+ "train_runtime": 64.3878,
20
+ "train_tokens_per_second": 677.892
21
  },
22
  {
23
  "epoch": 0.04305705059203445,
24
+ "grad_norm": 16.372161865234375,
25
+ "learning_rate": 9.995423512524277e-06,
26
+ "loss": 0.7676,
27
+ "num_input_tokens_seen": 87072,
28
  "step": 20,
29
+ "train_runtime": 95.1979,
30
+ "train_tokens_per_second": 914.642
31
  },
32
  {
33
  "epoch": 0.06458557588805167,
34
+ "grad_norm": 11.686817169189453,
35
+ "learning_rate": 9.98934059499448e-06,
36
+ "loss": 0.5817,
37
+ "num_input_tokens_seen": 131520,
38
  "step": 30,
39
+ "train_runtime": 126.5065,
40
+ "train_tokens_per_second": 1039.63
41
  },
42
  {
43
  "epoch": 0.0861141011840689,
44
+ "grad_norm": 3.2975926399230957,
45
+ "learning_rate": 9.980727353510257e-06,
46
+ "loss": 0.3531,
47
+ "num_input_tokens_seen": 175680,
48
  "step": 40,
49
+ "train_runtime": 157.6702,
50
+ "train_tokens_per_second": 1114.225
51
  },
52
  {
53
  "epoch": 0.10764262648008611,
54
+ "grad_norm": 3.4886627197265625,
55
+ "learning_rate": 9.969588156242282e-06,
56
+ "loss": 0.3352,
57
+ "num_input_tokens_seen": 219584,
58
  "step": 50,
59
+ "train_runtime": 188.7104,
60
+ "train_tokens_per_second": 1163.603
61
  },
62
  {
63
  "epoch": 0.12917115177610333,
64
+ "grad_norm": 3.484487295150757,
65
+ "learning_rate": 9.95592865238951e-06,
66
+ "loss": 0.2298,
67
+ "num_input_tokens_seen": 263392,
68
  "step": 60,
69
+ "train_runtime": 219.7077,
70
+ "train_tokens_per_second": 1198.829
71
  },
72
  {
73
  "epoch": 0.15069967707212056,
74
+ "grad_norm": 4.422971725463867,
75
+ "learning_rate": 9.939755769314215e-06,
76
+ "loss": 0.1981,
77
+ "num_input_tokens_seen": 306912,
78
  "step": 70,
79
+ "train_runtime": 250.6069,
80
+ "train_tokens_per_second": 1224.675
81
  },
82
  {
83
  "epoch": 0.1722282023681378,
84
+ "grad_norm": 1.4185198545455933,
85
+ "learning_rate": 9.9210777090288e-06,
86
+ "loss": 0.1755,
87
+ "num_input_tokens_seen": 349824,
88
  "step": 80,
89
+ "train_runtime": 281.2405,
90
+ "train_tokens_per_second": 1243.86
91
  },
92
  {
93
  "epoch": 0.193756727664155,
94
+ "grad_norm": 1.1935056447982788,
95
+ "learning_rate": 9.899903944036185e-06,
96
+ "loss": 0.1791,
97
+ "num_input_tokens_seen": 393664,
98
  "step": 90,
99
+ "train_runtime": 312.2075,
100
+ "train_tokens_per_second": 1260.905
101
  },
102
  {
103
  "epoch": 0.21528525296017223,
104
+ "grad_norm": 2.463397741317749,
105
+ "learning_rate": 9.87624521252587e-06,
106
+ "loss": 0.2051,
107
+ "num_input_tokens_seen": 437952,
108
  "step": 100,
109
+ "train_runtime": 343.3508,
110
+ "train_tokens_per_second": 1275.523
111
  },
112
  {
113
  "epoch": 0.23681377825618946,
114
+ "grad_norm": 3.8650355339050293,
115
+ "learning_rate": 9.850113512928094e-06,
116
+ "loss": 0.1912,
117
+ "num_input_tokens_seen": 481472,
118
  "step": 110,
119
+ "train_runtime": 374.2539,
120
+ "train_tokens_per_second": 1286.485
121
  },
122
  {
123
  "epoch": 0.25834230355220666,
124
+ "grad_norm": 4.704444885253906,
125
+ "learning_rate": 9.821522097828884e-06,
126
+ "loss": 0.1637,
127
+ "num_input_tokens_seen": 525472,
128
  "step": 120,
129
+ "train_runtime": 405.4374,
130
+ "train_tokens_per_second": 1296.062
131
  },
132
  {
133
  "epoch": 0.2798708288482239,
134
+ "grad_norm": 2.7267754077911377,
135
+ "learning_rate": 9.790485467249065e-06,
136
+ "loss": 0.1537,
137
+ "num_input_tokens_seen": 569696,
138
  "step": 130,
139
+ "train_runtime": 436.4834,
140
+ "train_tokens_per_second": 1305.195
141
  },
142
  {
143
  "epoch": 0.3013993541442411,
144
+ "grad_norm": 3.512826681137085,
145
+ "learning_rate": 9.757019361290621e-06,
146
+ "loss": 0.1846,
147
+ "num_input_tokens_seen": 613760,
148
  "step": 140,
149
+ "train_runtime": 467.5968,
150
+ "train_tokens_per_second": 1312.584
151
  },
152
  {
153
  "epoch": 0.32292787944025836,
154
+ "grad_norm": 2.484517812728882,
155
+ "learning_rate": 9.721140752154182e-06,
156
+ "loss": 0.1872,
157
+ "num_input_tokens_seen": 657824,
158
  "step": 150,
159
+ "train_runtime": 498.6389,
160
+ "train_tokens_per_second": 1319.239
161
  },
162
  {
163
  "epoch": 0.3444564047362756,
164
+ "grad_norm": 2.296607255935669,
165
+ "learning_rate": 9.682867835531624e-06,
166
+ "loss": 0.1372,
167
+ "num_input_tokens_seen": 701760,
168
  "step": 160,
169
+ "train_runtime": 529.7256,
170
+ "train_tokens_per_second": 1324.761
171
  },
172
  {
173
  "epoch": 0.36598493003229277,
174
+ "grad_norm": 3.887946128845215,
175
+ "learning_rate": 9.642220021378212e-06,
176
+ "loss": 0.2028,
177
+ "num_input_tokens_seen": 745184,
178
  "step": 170,
179
+ "train_runtime": 560.5239,
180
+ "train_tokens_per_second": 1329.442
181
  },
182
  {
183
  "epoch": 0.38751345532831,
184
+ "grad_norm": 2.1227307319641113,
185
+ "learning_rate": 9.59921792406891e-06,
186
+ "loss": 0.1765,
187
+ "num_input_tokens_seen": 789216,
188
  "step": 180,
189
+ "train_runtime": 591.5958,
190
+ "train_tokens_per_second": 1334.046
191
  },
192
  {
193
  "epoch": 0.40904198062432723,
194
+ "grad_norm": 3.007882595062256,
195
+ "learning_rate": 9.553883351943882e-06,
196
+ "loss": 0.1882,
197
+ "num_input_tokens_seen": 832960,
198
  "step": 190,
199
+ "train_runtime": 622.6094,
200
+ "train_tokens_per_second": 1337.853
201
  },
202
  {
203
  "epoch": 0.43057050592034446,
204
+ "grad_norm": 1.8637208938598633,
205
+ "learning_rate": 9.506239296248497e-06,
206
+ "loss": 0.1336,
207
+ "num_input_tokens_seen": 877664,
208
  "step": 200,
209
+ "train_runtime": 654.0867,
210
+ "train_tokens_per_second": 1341.816
211
  },
212
  {
213
  "epoch": 0.4520990312163617,
214
+ "grad_norm": 1.1324244737625122,
215
+ "learning_rate": 9.456309919473384e-06,
216
+ "loss": 0.1521,
217
+ "num_input_tokens_seen": 921536,
218
  "step": 210,
219
+ "train_runtime": 685.133,
220
+ "train_tokens_per_second": 1345.047
221
  },
222
  {
223
  "epoch": 0.4736275565123789,
224
+ "grad_norm": 3.536208391189575,
225
+ "learning_rate": 9.404120543100553e-06,
226
+ "loss": 0.1864,
227
+ "num_input_tokens_seen": 965344,
228
  "step": 220,
229
+ "train_runtime": 716.7323,
230
+ "train_tokens_per_second": 1346.868
231
  },
232
  {
233
  "epoch": 0.4951560818083961,
234
+ "grad_norm": 1.73074209690094,
235
+ "learning_rate": 9.34969763476168e-06,
236
+ "loss": 0.1625,
237
+ "num_input_tokens_seen": 1008672,
238
  "step": 230,
239
+ "train_runtime": 747.5266,
240
+ "train_tokens_per_second": 1349.346
241
  },
242
  {
243
  "epoch": 0.5166846071044133,
244
+ "grad_norm": 1.4830386638641357,
245
+ "learning_rate": 9.293068794815175e-06,
246
+ "loss": 0.1456,
247
+ "num_input_tokens_seen": 1051936,
248
  "step": 240,
249
+ "train_runtime": 778.3038,
250
+ "train_tokens_per_second": 1351.575
251
  },
252
  {
253
  "epoch": 0.5382131324004306,
254
+ "grad_norm": 2.7361512184143066,
255
+ "learning_rate": 9.234262742348764e-06,
256
+ "loss": 0.165,
257
+ "num_input_tokens_seen": 1095904,
258
  "step": 250,
259
+ "train_runtime": 809.3485,
260
+ "train_tokens_per_second": 1354.057
261
  },
262
  {
263
  "epoch": 0.5597416576964478,
264
+ "grad_norm": 1.9473741054534912,
265
+ "learning_rate": 9.17330930061471e-06,
266
+ "loss": 0.1487,
267
+ "num_input_tokens_seen": 1140064,
268
  "step": 260,
269
+ "train_runtime": 840.5464,
270
+ "train_tokens_per_second": 1356.337
271
  },
272
  {
273
  "epoch": 0.581270182992465,
274
+ "grad_norm": 2.0610098838806152,
275
+ "learning_rate": 9.11023938190509e-06,
276
+ "loss": 0.1687,
277
+ "num_input_tokens_seen": 1183872,
278
  "step": 270,
279
+ "train_runtime": 871.5774,
280
+ "train_tokens_per_second": 1358.31
281
  },
282
  {
283
  "epoch": 0.6027987082884823,
284
+ "grad_norm": 3.2189598083496094,
285
+ "learning_rate": 9.045084971874738e-06,
286
+ "loss": 0.1511,
287
+ "num_input_tokens_seen": 1228544,
288
  "step": 280,
289
+ "train_runtime": 903.1191,
290
+ "train_tokens_per_second": 1360.334
291
  },
292
  {
293
  "epoch": 0.6243272335844995,
294
+ "grad_norm": 3.902757406234741,
295
+ "learning_rate": 8.977879113319847e-06,
296
+ "loss": 0.184,
297
+ "num_input_tokens_seen": 1271968,
298
  "step": 290,
299
+ "train_runtime": 934.0522,
300
+ "train_tokens_per_second": 1361.774
301
  },
302
  {
303
  "epoch": 0.6458557588805167,
304
+ "grad_norm": 4.2983012199401855,
305
+ "learning_rate": 8.90865588942046e-06,
306
+ "loss": 0.1305,
307
+ "num_input_tokens_seen": 1316096,
308
  "step": 300,
309
+ "train_runtime": 965.1778,
310
+ "train_tokens_per_second": 1363.579
311
  },
312
  {
313
  "epoch": 0.667384284176534,
314
+ "grad_norm": 2.6156394481658936,
315
+ "learning_rate": 8.83745040645531e-06,
316
+ "loss": 0.1405,
317
+ "num_input_tokens_seen": 1360256,
318
  "step": 310,
319
+ "train_runtime": 996.4077,
320
+ "train_tokens_per_second": 1365.16
321
  },
322
  {
323
  "epoch": 0.6889128094725512,
324
+ "grad_norm": 1.3506444692611694,
325
+ "learning_rate": 8.764298775997823e-06,
326
+ "loss": 0.1651,
327
+ "num_input_tokens_seen": 1404064,
328
  "step": 320,
329
+ "train_runtime": 1027.5151,
330
+ "train_tokens_per_second": 1366.466
331
  },
332
  {
333
  "epoch": 0.7104413347685683,
334
+ "grad_norm": 1.5117799043655396,
335
+ "learning_rate": 8.68923809660227e-06,
336
+ "loss": 0.1519,
337
+ "num_input_tokens_seen": 1448256,
338
  "step": 330,
339
+ "train_runtime": 1058.74,
340
+ "train_tokens_per_second": 1367.905
341
  },
342
  {
343
  "epoch": 0.7319698600645855,
344
+ "grad_norm": 1.2659231424331665,
345
+ "learning_rate": 8.612306434989395e-06,
346
+ "loss": 0.1574,
347
+ "num_input_tokens_seen": 1492448,
348
  "step": 340,
349
+ "train_runtime": 1090.0052,
350
+ "train_tokens_per_second": 1369.212
351
  },
352
  {
353
  "epoch": 0.7534983853606028,
354
+ "grad_norm": 2.6010894775390625,
355
+ "learning_rate": 8.53354280674102e-06,
356
+ "loss": 0.1587,
357
+ "num_input_tokens_seen": 1537440,
358
  "step": 350,
359
+ "train_runtime": 1121.55,
360
+ "train_tokens_per_second": 1370.817
361
  },
362
  {
363
  "epoch": 0.77502691065662,
364
+ "grad_norm": 1.6968097686767578,
365
+ "learning_rate": 8.452987156513457e-06,
366
+ "loss": 0.1513,
367
+ "num_input_tokens_seen": 1581280,
368
  "step": 360,
369
+ "train_runtime": 1152.6858,
370
+ "train_tokens_per_second": 1371.822
371
  },
372
  {
373
  "epoch": 0.7965554359526372,
374
+ "grad_norm": 2.0298380851745605,
375
+ "learning_rate": 8.370680337779737e-06,
376
+ "loss": 0.1401,
377
+ "num_input_tokens_seen": 1625824,
378
  "step": 370,
379
+ "train_runtime": 1184.3507,
380
+ "train_tokens_per_second": 1372.756
381
  },
382
  {
383
  "epoch": 0.8180839612486545,
384
+ "grad_norm": 2.7614028453826904,
385
+ "learning_rate": 8.286664092110935e-06,
386
+ "loss": 0.1135,
387
+ "num_input_tokens_seen": 1669472,
388
  "step": 380,
389
+ "train_runtime": 1215.2935,
390
+ "train_tokens_per_second": 1373.719
391
  },
392
  {
393
  "epoch": 0.8396124865446717,
394
+ "grad_norm": 1.6297581195831299,
395
+ "learning_rate": 8.200981028007095e-06,
396
+ "loss": 0.1645,
397
+ "num_input_tokens_seen": 1713312,
398
  "step": 390,
399
+ "train_runtime": 1246.1254,
400
+ "train_tokens_per_second": 1374.911
401
  },
402
  {
403
  "epoch": 0.8611410118406889,
404
+ "grad_norm": 2.32612943649292,
405
+ "learning_rate": 8.11367459928851e-06,
406
+ "loss": 0.1129,
407
+ "num_input_tokens_seen": 1757056,
408
  "step": 400,
409
+ "train_runtime": 1277.0951,
410
+ "train_tokens_per_second": 1375.822
411
  },
412
  {
413
  "epoch": 0.8826695371367062,
414
+ "grad_norm": 1.5576270818710327,
415
+ "learning_rate": 8.024789083058289e-06,
416
+ "loss": 0.1333,
417
+ "num_input_tokens_seen": 1801632,
418
  "step": 410,
419
+ "train_runtime": 1308.5556,
420
+ "train_tokens_per_second": 1376.81
421
  },
422
  {
423
  "epoch": 0.9041980624327234,
424
+ "grad_norm": 8.420344352722168,
425
+ "learning_rate": 7.934369557247397e-06,
426
+ "loss": 0.1311,
427
+ "num_input_tokens_seen": 1845280,
428
  "step": 420,
429
+ "train_runtime": 1339.4668,
430
+ "train_tokens_per_second": 1377.623
431
  },
432
  {
433
  "epoch": 0.9257265877287406,
434
+ "grad_norm": 1.7291479110717773,
435
+ "learning_rate": 7.842461877753575e-06,
436
+ "loss": 0.1395,
437
+ "num_input_tokens_seen": 1889472,
438
  "step": 430,
439
+ "train_runtime": 1370.6369,
440
+ "train_tokens_per_second": 1378.536
441
  },
442
  {
443
  "epoch": 0.9472551130247578,
444
+ "grad_norm": 2.441693067550659,
445
+ "learning_rate": 7.7491126551857e-06,
446
+ "loss": 0.1175,
447
+ "num_input_tokens_seen": 1932832,
448
  "step": 440,
449
+ "train_runtime": 1401.3047,
450
+ "train_tokens_per_second": 1379.309
451
  },
452
  {
453
  "epoch": 0.9687836383207751,
454
+ "grad_norm": 1.3606727123260498,
455
+ "learning_rate": 7.654369231225398e-06,
456
+ "loss": 0.1154,
457
+ "num_input_tokens_seen": 1976000,
458
  "step": 450,
459
+ "train_runtime": 1431.9402,
460
+ "train_tokens_per_second": 1379.946
461
  },
462
  {
463
  "epoch": 0.9903121636167922,
464
+ "grad_norm": 2.911600351333618,
465
+ "learning_rate": 7.5582796546179125e-06,
466
+ "loss": 0.1408,
467
+ "num_input_tokens_seen": 2019968,
468
  "step": 460,
469
+ "train_runtime": 1463.035,
470
+ "train_tokens_per_second": 1380.67
471
  },
472
  {
473
  "epoch": 1.0107642626480087,
474
+ "grad_norm": 2.967047929763794,
475
+ "learning_rate": 7.460892656804366e-06,
476
+ "loss": 0.1126,
477
+ "num_input_tokens_seen": 2061440,
478
  "step": 470,
479
+ "train_runtime": 1492.4083,
480
+ "train_tokens_per_second": 1381.284
481
  },
482
  {
483
  "epoch": 1.0322927879440258,
484
+ "grad_norm": 1.90776789188385,
485
+ "learning_rate": 7.362257627207818e-06,
486
+ "loss": 0.1329,
487
+ "num_input_tokens_seen": 2105216,
488
  "step": 480,
489
+ "train_runtime": 1523.2979,
490
+ "train_tokens_per_second": 1382.012
491
  },
492
  {
493
  "epoch": 1.0538213132400431,
494
+ "grad_norm": 2.7770872116088867,
495
+ "learning_rate": 7.2624245881856094e-06,
496
+ "loss": 0.111,
497
+ "num_input_tokens_seen": 2149888,
498
  "step": 490,
499
+ "train_runtime": 1554.9287,
500
+ "train_tokens_per_second": 1382.628
501
  },
502
  {
503
  "epoch": 1.0753498385360603,
504
+ "grad_norm": 1.9737987518310547,
505
+ "learning_rate": 7.161444169660723e-06,
506
+ "loss": 0.113,
507
+ "num_input_tokens_seen": 2194304,
508
  "step": 500,
509
+ "train_runtime": 1586.2216,
510
+ "train_tokens_per_second": 1383.353
511
  },
512
  {
513
  "epoch": 1.0968783638320776,
514
+ "grad_norm": 1.2335457801818848,
515
+ "learning_rate": 7.059367583445034e-06,
516
+ "loss": 0.1303,
517
+ "num_input_tokens_seen": 2238080,
518
  "step": 510,
519
+ "train_runtime": 1617.0801,
520
+ "train_tokens_per_second": 1384.025
521
  },
522
  {
523
  "epoch": 1.1184068891280947,
524
+ "grad_norm": 2.525258779525757,
525
+ "learning_rate": 6.956246597267438e-06,
526
+ "loss": 0.1404,
527
+ "num_input_tokens_seen": 2282368,
528
  "step": 520,
529
+ "train_runtime": 1648.4109,
530
+ "train_tokens_per_second": 1384.587
531
  },
532
  {
533
  "epoch": 1.1399354144241118,
534
+ "grad_norm": 4.016520977020264,
535
+ "learning_rate": 6.852133508520057e-06,
536
+ "loss": 0.0972,
537
+ "num_input_tokens_seen": 2325984,
538
  "step": 530,
539
+ "train_runtime": 1679.3164,
540
+ "train_tokens_per_second": 1385.078
541
  },
542
  {
543
  "epoch": 1.1614639397201292,
544
+ "grad_norm": 1.405586838722229,
545
+ "learning_rate": 6.747081117735829e-06,
546
+ "loss": 0.1092,
547
+ "num_input_tokens_seen": 2369664,
548
  "step": 540,
549
+ "train_runtime": 1710.2475,
550
+ "train_tokens_per_second": 1385.568
551
  },
552
  {
553
  "epoch": 1.1829924650161463,
554
+ "grad_norm": 2.151442766189575,
555
+ "learning_rate": 6.641142701810932e-06,
556
+ "loss": 0.1186,
557
+ "num_input_tokens_seen": 2413312,
558
  "step": 550,
559
+ "train_runtime": 1741.213,
560
+ "train_tokens_per_second": 1385.995
561
  },
562
  {
563
  "epoch": 1.2045209903121636,
564
+ "grad_norm": 1.9706578254699707,
565
+ "learning_rate": 6.534371986985618e-06,
566
+ "loss": 0.1332,
567
+ "num_input_tokens_seen": 2457120,
568
  "step": 560,
569
+ "train_runtime": 1772.1204,
570
+ "train_tokens_per_second": 1386.542
571
  },
572
  {
573
  "epoch": 1.2260495156081808,
574
+ "grad_norm": 2.3035449981689453,
575
+ "learning_rate": 6.426823121597169e-06,
576
+ "loss": 0.1481,
577
+ "num_input_tokens_seen": 2500736,
578
  "step": 570,
579
+ "train_runtime": 1803.0834,
580
+ "train_tokens_per_second": 1386.922
581
  },
582
  {
583
  "epoch": 1.247578040904198,
584
+ "grad_norm": 3.713632106781006,
585
+ "learning_rate": 6.318550648618785e-06,
586
+ "loss": 0.1332,
587
+ "num_input_tokens_seen": 2545056,
588
  "step": 580,
589
+ "train_runtime": 1834.1935,
590
+ "train_tokens_per_second": 1387.561
591
  },
592
  {
593
  "epoch": 1.2691065662002152,
594
+ "grad_norm": 1.8667478561401367,
595
+ "learning_rate": 6.209609477998339e-06,
596
+ "loss": 0.0978,
597
+ "num_input_tokens_seen": 2588416,
598
  "step": 590,
599
+ "train_runtime": 1864.9784,
600
+ "train_tokens_per_second": 1387.907
601
  },
602
  {
603
  "epoch": 1.2906350914962326,
604
+ "grad_norm": 2.295342445373535,
605
+ "learning_rate": 6.100054858811012e-06,
606
+ "loss": 0.1176,
607
+ "num_input_tokens_seen": 2632352,
608
  "step": 600,
609
+ "train_runtime": 1896.108,
610
+ "train_tokens_per_second": 1388.292
611
  },
612
  {
613
  "epoch": 1.3121636167922497,
614
+ "grad_norm": 2.2867720127105713,
615
+ "learning_rate": 5.989942351239954e-06,
616
+ "loss": 0.1279,
617
+ "num_input_tokens_seen": 2676640,
618
  "step": 610,
619
+ "train_runtime": 1927.5126,
620
+ "train_tokens_per_second": 1388.65
621
  },
622
  {
623
  "epoch": 1.333692142088267,
624
+ "grad_norm": 2.1158223152160645,
625
+ "learning_rate": 5.879327798399155e-06,
626
+ "loss": 0.1407,
627
+ "num_input_tokens_seen": 2719968,
628
  "step": 620,
629
+ "train_runtime": 1958.2576,
630
+ "train_tokens_per_second": 1388.974
631
  },
632
  {
633
  "epoch": 1.3552206673842842,
634
+ "grad_norm": 4.076441287994385,
635
+ "learning_rate": 5.768267298012841e-06,
636
+ "loss": 0.1168,
637
+ "num_input_tokens_seen": 2764352,
638
  "step": 630,
639
+ "train_runtime": 1989.6781,
640
+ "train_tokens_per_second": 1389.346
641
  },
642
  {
643
  "epoch": 1.3767491926803013,
644
+ "grad_norm": 4.354236602783203,
645
+ "learning_rate": 5.656817173965733e-06,
646
+ "loss": 0.1188,
647
+ "num_input_tokens_seen": 2808832,
648
  "step": 640,
649
+ "train_runtime": 2021.0224,
650
+ "train_tokens_per_second": 1389.807
651
  },
652
  {
653
  "epoch": 1.3982777179763186,
654
+ "grad_norm": 4.40167236328125,
655
+ "learning_rate": 5.545033947738624e-06,
656
+ "loss": 0.1326,
657
+ "num_input_tokens_seen": 2852192,
658
  "step": 650,
659
+ "train_runtime": 2051.72,
660
+ "train_tokens_per_second": 1390.147
661
  },
662
  {
663
  "epoch": 1.419806243272336,
664
+ "grad_norm": 2.4845104217529297,
665
+ "learning_rate": 5.4329743097437316e-06,
666
+ "loss": 0.1331,
667
+ "num_input_tokens_seen": 2896256,
668
  "step": 660,
669
+ "train_runtime": 2082.7361,
670
+ "train_tokens_per_second": 1390.602
671
  },
672
  {
673
  "epoch": 1.441334768568353,
674
+ "grad_norm": 2.7233705520629883,
675
+ "learning_rate": 5.320695090574386e-06,
676
+ "loss": 0.1082,
677
+ "num_input_tokens_seen": 2939552,
678
  "step": 670,
679
+ "train_runtime": 2113.5367,
680
+ "train_tokens_per_second": 1390.821
681
  },
682
  {
683
  "epoch": 1.4628632938643702,
684
+ "grad_norm": 3.289949893951416,
685
+ "learning_rate": 5.208253232183625e-06,
686
+ "loss": 0.1184,
687
+ "num_input_tokens_seen": 2984000,
688
  "step": 680,
689
+ "train_runtime": 2144.7931,
690
+ "train_tokens_per_second": 1391.276
691
  },
692
  {
693
  "epoch": 1.4843918191603875,
694
+ "grad_norm": 4.015010833740234,
695
+ "learning_rate": 5.095705759006311e-06,
696
+ "loss": 0.0942,
697
+ "num_input_tokens_seen": 3028192,
698
  "step": 690,
699
+ "train_runtime": 2176.0229,
700
+ "train_tokens_per_second": 1391.618
701
  },
702
  {
703
  "epoch": 1.5059203444564049,
704
+ "grad_norm": 5.474874973297119,
705
+ "learning_rate": 4.9831097490394195e-06,
706
+ "loss": 0.1204,
707
+ "num_input_tokens_seen": 3071392,
708
  "step": 700,
709
+ "train_runtime": 2206.8218,
710
+ "train_tokens_per_second": 1391.772
711
  },
712
  {
713
  "epoch": 1.527448869752422,
714
+ "grad_norm": 2.4211018085479736,
715
+ "learning_rate": 4.870522304895164e-06,
716
+ "loss": 0.1358,
717
+ "num_input_tokens_seen": 3114496,
718
  "step": 710,
719
+ "train_runtime": 2237.5127,
720
+ "train_tokens_per_second": 1391.946
721
  },
722
  {
723
  "epoch": 1.5489773950484391,
724
+ "grad_norm": 2.5446665287017822,
725
+ "learning_rate": 4.758000524841632e-06,
726
+ "loss": 0.1313,
727
+ "num_input_tokens_seen": 3158432,
728
  "step": 720,
729
+ "train_runtime": 2268.6496,
730
+ "train_tokens_per_second": 1392.208
731
  },
732
  {
733
  "epoch": 1.5705059203444565,
734
+ "grad_norm": 5.643487453460693,
735
+ "learning_rate": 4.645601473845636e-06,
736
+ "loss": 0.0879,
737
+ "num_input_tokens_seen": 3201888,
738
  "step": 730,
739
+ "train_runtime": 2299.4823,
740
+ "train_tokens_per_second": 1392.439
741
  },
742
  {
743
  "epoch": 1.5920344456404736,
744
+ "grad_norm": 1.8654100894927979,
745
+ "learning_rate": 4.533382154632442e-06,
746
+ "loss": 0.0977,
747
+ "num_input_tokens_seen": 3245856,
748
  "step": 740,
749
+ "train_runtime": 2330.5679,
750
+ "train_tokens_per_second": 1392.732
751
  },
752
  {
753
  "epoch": 1.6135629709364907,
754
+ "grad_norm": 2.2264926433563232,
755
+ "learning_rate": 4.421399478777064e-06,
756
+ "loss": 0.1483,
757
+ "num_input_tokens_seen": 3290208,
758
  "step": 750,
759
+ "train_runtime": 2361.9169,
760
+ "train_tokens_per_second": 1393.024
761
  },
762
  {
763
  "epoch": 1.635091496232508,
764
+ "grad_norm": 2.8280999660491943,
765
+ "learning_rate": 4.3097102378417985e-06,
766
+ "loss": 0.1285,
767
+ "num_input_tokens_seen": 3333152,
768
  "step": 760,
769
+ "train_runtime": 2392.5926,
770
+ "train_tokens_per_second": 1393.113
771
  },
772
  {
773
  "epoch": 1.6566200215285254,
774
+ "grad_norm": 3.5213840007781982,
775
+ "learning_rate": 4.198371074574597e-06,
776
+ "loss": 0.1475,
777
+ "num_input_tokens_seen": 3377664,
778
  "step": 770,
779
+ "train_runtime": 2423.9491,
780
+ "train_tokens_per_second": 1393.455
781
  },
782
  {
783
  "epoch": 1.6781485468245425,
784
+ "grad_norm": 3.323622226715088,
785
+ "learning_rate": 4.087438454182942e-06,
786
+ "loss": 0.0904,
787
+ "num_input_tokens_seen": 3422400,
788
  "step": 780,
789
+ "train_runtime": 2455.5818,
790
+ "train_tokens_per_second": 1393.723
791
  },
792
  {
793
  "epoch": 1.6996770721205596,
794
+ "grad_norm": 4.368185997009277,
795
+ "learning_rate": 3.976968635697732e-06,
796
+ "loss": 0.1199,
797
+ "num_input_tokens_seen": 3465760,
798
  "step": 790,
799
+ "train_runtime": 2486.3362,
800
+ "train_tokens_per_second": 1393.922
801
  },
802
  {
803
  "epoch": 1.721205597416577,
804
+ "grad_norm": 3.0081822872161865,
805
+ "learning_rate": 3.867017643441746e-06,
806
+ "loss": 0.102,
807
+ "num_input_tokens_seen": 3509760,
808
  "step": 800,
809
+ "train_runtime": 2517.434,
810
+ "train_tokens_per_second": 1394.182
811
  },
812
  {
813
  "epoch": 1.7427341227125943,
814
+ "grad_norm": 3.7257721424102783,
815
+ "learning_rate": 3.757641238617137e-06,
816
+ "loss": 0.1194,
817
+ "num_input_tokens_seen": 3554560,
818
  "step": 810,
819
+ "train_runtime": 2549.4732,
820
+ "train_tokens_per_second": 1394.233
821
  },
822
  {
823
  "epoch": 1.7642626480086114,
824
+ "grad_norm": 3.8365535736083984,
825
+ "learning_rate": 3.648894891026358e-06,
826
+ "loss": 0.1507,
827
+ "num_input_tokens_seen": 3599488,
828
  "step": 820,
829
+ "train_runtime": 2581.0241,
830
+ "train_tokens_per_second": 1394.597
831
  },
832
  {
833
  "epoch": 1.7857911733046286,
834
+ "grad_norm": 2.1309561729431152,
835
+ "learning_rate": 3.5408337509408764e-06,
836
+ "loss": 0.1015,
837
+ "num_input_tokens_seen": 3643680,
838
  "step": 830,
839
+ "train_runtime": 2612.3216,
840
+ "train_tokens_per_second": 1394.805
841
  },
842
  {
843
  "epoch": 1.807319698600646,
844
+ "grad_norm": 2.5082457065582275,
845
+ "learning_rate": 3.4335126211319412e-06,
846
+ "loss": 0.1165,
847
+ "num_input_tokens_seen": 3688160,
848
  "step": 840,
849
+ "train_runtime": 2643.6717,
850
+ "train_tokens_per_second": 1395.09
851
  },
852
  {
853
  "epoch": 1.8288482238966632,
854
+ "grad_norm": 1.4419660568237305,
855
+ "learning_rate": 3.32698592907757e-06,
856
+ "loss": 0.0958,
857
+ "num_input_tokens_seen": 3731392,
858
  "step": 850,
859
+ "train_runtime": 2674.4286,
860
+ "train_tokens_per_second": 1395.211
861
  },
862
  {
863
  "epoch": 1.8503767491926801,
864
+ "grad_norm": 2.402513027191162,
865
+ "learning_rate": 3.2213076993598857e-06,
866
+ "loss": 0.1505,
867
+ "num_input_tokens_seen": 3776128,
868
  "step": 860,
869
+ "train_runtime": 2706.116,
870
+ "train_tokens_per_second": 1395.405
871
  },
872
  {
873
  "epoch": 1.8719052744886975,
874
+ "grad_norm": 0.9779609441757202,
875
+ "learning_rate": 3.1165315262667535e-06,
876
+ "loss": 0.1003,
877
+ "num_input_tokens_seen": 3820896,
878
  "step": 870,
879
+ "train_runtime": 2737.6181,
880
+ "train_tokens_per_second": 1395.701
881
  },
882
  {
883
  "epoch": 1.8934337997847148,
884
+ "grad_norm": 3.727255344390869,
885
+ "learning_rate": 3.012710546611659e-06,
886
+ "loss": 0.1483,
887
+ "num_input_tokens_seen": 3864704,
888
  "step": 880,
889
+ "train_runtime": 2768.6885,
890
+ "train_tokens_per_second": 1395.861
891
  },
892
  {
893
  "epoch": 1.914962325080732,
894
+ "grad_norm": 1.5679094791412354,
895
+ "learning_rate": 2.9098974127856e-06,
896
+ "loss": 0.117,
897
+ "num_input_tokens_seen": 3908544,
898
  "step": 890,
899
+ "train_runtime": 2799.6713,
900
+ "train_tokens_per_second": 1396.072
901
  },
902
  {
903
  "epoch": 1.936490850376749,
904
+ "grad_norm": 2.775408983230591,
905
+ "learning_rate": 2.8081442660546126e-06,
906
+ "loss": 0.1303,
907
+ "num_input_tokens_seen": 3952576,
908
  "step": 900,
909
+ "train_runtime": 2830.9247,
910
+ "train_tokens_per_second": 1396.214
911
  },
912
  {
913
  "epoch": 1.9580193756727664,
914
+ "grad_norm": 1.0387197732925415,
915
+ "learning_rate": 2.7075027101165706e-06,
916
+ "loss": 0.0971,
917
+ "num_input_tokens_seen": 3996416,
918
  "step": 910,
919
+ "train_runtime": 2862.0695,
920
+ "train_tokens_per_second": 1396.338
921
  },
922
  {
923
  "epoch": 1.9795479009687837,
924
+ "grad_norm": 3.794166326522827,
925
+ "learning_rate": 2.6080237849305467e-06,
926
+ "loss": 0.132,
927
+ "num_input_tokens_seen": 4040736,
928
  "step": 920,
929
+ "train_runtime": 2893.2903,
930
+ "train_tokens_per_second": 1396.589
931
  },
932
  {
933
  "epoch": 2.0,
934
+ "grad_norm": 1.547866702079773,
935
+ "learning_rate": 2.5097579408321264e-06,
936
+ "loss": 0.093,
937
+ "num_input_tokens_seen": 4083200,
938
  "step": 930,
939
+ "train_runtime": 2923.2158,
940
+ "train_tokens_per_second": 1396.818
941
  },
942
  {
943
  "epoch": 2.0215285252960173,
944
+ "grad_norm": 3.5177085399627686,
945
+ "learning_rate": 2.4127550129477145e-06,
946
+ "loss": 0.1324,
947
+ "num_input_tokens_seen": 4127040,
948
  "step": 940,
949
+ "train_runtime": 2954.2784,
950
+ "train_tokens_per_second": 1396.971
951
  },
952
  {
953
  "epoch": 2.0430570505920342,
954
+ "grad_norm": 1.8717275857925415,
955
+ "learning_rate": 2.317064195920852e-06,
956
+ "loss": 0.0841,
957
+ "num_input_tokens_seen": 4170816,
958
  "step": 950,
959
+ "train_runtime": 2985.3333,
960
+ "train_tokens_per_second": 1397.102
961
  },
962
  {
963
  "epoch": 2.0645855758880516,
964
+ "grad_norm": 1.233929991722107,
965
+ "learning_rate": 2.2227340189633508e-06,
966
+ "loss": 0.1138,
967
+ "num_input_tokens_seen": 4214272,
968
  "step": 960,
969
+ "train_runtime": 3016.1559,
970
+ "train_tokens_per_second": 1397.233
971
  },
972
  {
973
  "epoch": 2.086114101184069,
974
+ "grad_norm": 1.6053682565689087,
975
+ "learning_rate": 2.1298123212439028e-06,
976
+ "loss": 0.0892,
977
+ "num_input_tokens_seen": 4258592,
978
  "step": 970,
979
+ "train_runtime": 3047.3824,
980
+ "train_tokens_per_second": 1397.459
981
  },
982
  {
983
  "epoch": 2.1076426264800863,
984
+ "grad_norm": 2.4293172359466553,
985
+ "learning_rate": 2.0383462276266347e-06,
986
+ "loss": 0.1277,
987
+ "num_input_tokens_seen": 4302656,
988
  "step": 980,
989
+ "train_runtime": 3078.5923,
990
+ "train_tokens_per_second": 1397.605
991
  },
992
  {
993
  "epoch": 2.129171151776103,
994
+ "grad_norm": 2.0637197494506836,
995
+ "learning_rate": 1.948382124771927e-06,
996
+ "loss": 0.0968,
997
+ "num_input_tokens_seen": 4345888,
998
  "step": 990,
999
+ "train_runtime": 3109.3083,
1000
+ "train_tokens_per_second": 1397.703
1001
  },
1002
  {
1003
  "epoch": 2.1506996770721205,
1004
+ "grad_norm": 3.5659446716308594,
1005
+ "learning_rate": 1.8599656376116026e-06,
1006
+ "loss": 0.1226,
1007
+ "num_input_tokens_seen": 4390528,
1008
  "step": 1000,
1009
+ "train_runtime": 3140.7259,
1010
+ "train_tokens_per_second": 1397.934
1011
  }
1012
  ],
1013
  "logging_steps": 10,
1014
  "max_steps": 1395,
1015
+ "num_input_tokens_seen": 4390528,
1016
  "num_train_epochs": 3,
1017
  "save_steps": 1000,
1018
  "stateful_callbacks": {
 
1027
  "attributes": {}
1028
  }
1029
  },
1030
+ "total_flos": 2.952664227770573e+17,
1031
  "train_batch_size": 4,
1032
  "trial_name": null,
1033
  "trial_params": null
checkpoint-1000/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9c29c975621e6dfe5a87aa7a2dbd3a9fa540f81cbdafb9999ffa93dc268922e3
3
  size 6161
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:57039f57f730004d2db4291a164c9a267ccb02be9b83d34e8933cba3e52ae325
3
  size 6161
checkpoint-1395/adapter_config.json CHANGED
@@ -28,154 +28,154 @@
28
  "rank_pattern": {},
29
  "revision": null,
30
  "target_modules": [
31
- "language_model.layers.6.self_attn.v_proj",
32
- "37.self_attn.v_proj",
33
- "46.self_attn.q_proj",
34
- "32.self_attn.v_proj",
35
- "29.self_attn.q_proj",
36
- "language_model.layers.22.self_attn.v_proj",
37
- "language_model.layers.26.self_attn.v_proj",
38
- "language_model.layers.24.self_attn.v_proj",
39
- "language_model.layers.9.self_attn.q_proj",
40
- "27.self_attn.k_proj",
41
- "47.self_attn.k_proj",
42
- "language_model.layers.19.self_attn.k_proj",
43
- "38.self_attn.q_proj",
44
- "44.self_attn.k_proj",
45
- "31.self_attn.q_proj",
46
- "31.self_attn.v_proj",
47
- "language_model.layers.4.self_attn.v_proj",
48
- "40.self_attn.q_proj",
49
- "language_model.layers.10.self_attn.k_proj",
50
- "27.self_attn.q_proj",
51
- "language_model.layers.6.self_attn.q_proj",
52
- "language_model.layers.9.self_attn.k_proj",
53
  "33.self_attn.q_proj",
54
- "37.self_attn.k_proj",
55
- "language_model.layers.0.self_attn.v_proj",
56
- "language_model.layers.17.self_attn.v_proj",
57
- "28.self_attn.q_proj",
58
- "29.self_attn.k_proj",
59
- "46.self_attn.k_proj",
60
- "language_model.layers.26.self_attn.q_proj",
61
- "33.self_attn.k_proj",
62
- "language_model.layers.23.self_attn.v_proj",
63
- "36.self_attn.q_proj",
64
- "32.self_attn.q_proj",
65
- "language_model.layers.23.self_attn.q_proj",
66
- "29.self_attn.v_proj",
67
- "language_model.layers.18.self_attn.k_proj",
68
- "language_model.layers.21.self_attn.q_proj",
69
- "40.self_attn.v_proj",
70
- "language_model.layers.10.self_attn.q_proj",
71
- "30.self_attn.k_proj",
72
- "language_model.layers.25.self_attn.q_proj",
73
- "language_model.layers.6.self_attn.k_proj",
74
- "43.self_attn.k_proj",
75
- "language_model.layers.14.self_attn.k_proj",
76
- "language_model.layers.4.self_attn.q_proj",
77
- "41.self_attn.k_proj",
78
- "30.self_attn.v_proj",
79
- "45.self_attn.q_proj",
80
- "language_model.layers.18.self_attn.q_proj",
81
- "language_model.layers.7.self_attn.v_proj",
82
- "language_model.layers.25.self_attn.v_proj",
83
  "language_model.layers.26.self_attn.k_proj",
84
- "language_model.layers.15.self_attn.k_proj",
85
- "language_model.layers.21.self_attn.k_proj",
86
- "language_model.layers.20.self_attn.q_proj",
87
- "31.self_attn.k_proj",
88
- "language_model.layers.1.self_attn.q_proj",
89
- "language_model.layers.24.self_attn.k_proj",
90
- "45.self_attn.v_proj",
91
- "36.self_attn.k_proj",
92
- "language_model.layers.3.self_attn.v_proj",
93
- "language_model.layers.12.self_attn.v_proj",
94
  "language_model.layers.25.self_attn.k_proj",
95
- "language_model.layers.18.self_attn.v_proj",
96
- "down_proj",
97
- "language_model.layers.12.self_attn.k_proj",
98
- "language_model.layers.14.self_attn.q_proj",
99
  "42.self_attn.v_proj",
100
- "language_model.layers.3.self_attn.k_proj",
101
- "language_model.layers.10.self_attn.v_proj",
102
- "language_model.layers.11.self_attn.q_proj",
103
- "36.self_attn.v_proj",
104
- "44.self_attn.q_proj",
105
- "language_model.layers.5.self_attn.k_proj",
106
- "38.self_attn.v_proj",
107
- "35.self_attn.q_proj",
108
  "language_model.layers.15.self_attn.v_proj",
 
 
109
  "45.self_attn.k_proj",
110
- "o_proj",
111
- "language_model.layers.7.self_attn.k_proj",
112
- "language_model.layers.13.self_attn.v_proj",
113
- "27.self_attn.v_proj",
114
- "language_model.layers.8.self_attn.k_proj",
115
- "language_model.layers.20.self_attn.k_proj",
116
- "46.self_attn.v_proj",
117
  "34.self_attn.v_proj",
 
 
 
118
  "34.self_attn.q_proj",
119
- "language_model.layers.12.self_attn.q_proj",
120
- "language_model.layers.17.self_attn.k_proj",
121
  "language_model.layers.2.self_attn.v_proj",
122
- "39.self_attn.v_proj",
123
- "language_model.layers.4.self_attn.k_proj",
124
- "41.self_attn.q_proj",
125
- "language_model.layers.8.self_attn.q_proj",
 
 
 
 
126
  "39.self_attn.q_proj",
127
- "language_model.layers.0.self_attn.k_proj",
128
- "language_model.layers.21.self_attn.v_proj",
129
- "39.self_attn.k_proj",
130
- "47.self_attn.q_proj",
131
- "32.self_attn.k_proj",
132
- "43.self_attn.v_proj",
133
  "language_model.layers.2.self_attn.q_proj",
134
- "47.self_attn.v_proj",
135
- "37.self_attn.q_proj",
136
- "language_model.layers.19.self_attn.v_proj",
 
 
 
 
137
  "language_model.layers.13.self_attn.k_proj",
138
- "42.self_attn.k_proj",
139
- "language_model.layers.23.self_attn.k_proj",
 
 
 
 
 
140
  "language_model.layers.3.self_attn.q_proj",
141
- "language_model.layers.20.self_attn.v_proj",
142
- "30.self_attn.q_proj",
 
 
 
 
 
 
 
 
 
143
  "28.self_attn.k_proj",
144
- "language_model.layers.22.self_attn.k_proj",
145
- "language_model.layers.19.self_attn.q_proj",
146
- "language_model.layers.2.self_attn.k_proj",
147
- "language_model.layers.1.self_attn.k_proj",
148
  "language_model.layers.13.self_attn.q_proj",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
149
  "language_model.layers.0.self_attn.q_proj",
150
- "44.self_attn.v_proj",
151
- "up_proj",
 
 
 
 
152
  "33.self_attn.v_proj",
153
- "language_model.layers.15.self_attn.q_proj",
154
- "language_model.layers.8.self_attn.v_proj",
155
- "language_model.layers.16.self_attn.v_proj",
156
- "language_model.layers.16.self_attn.k_proj",
157
- "35.self_attn.k_proj",
158
- "42.self_attn.q_proj",
159
- "language_model.layers.1.self_attn.v_proj",
160
- "34.self_attn.k_proj",
161
- "43.self_attn.q_proj",
162
- "language_model.layers.9.self_attn.v_proj",
163
  "language_model.layers.17.self_attn.q_proj",
164
- "28.self_attn.v_proj",
 
 
 
 
 
165
  "38.self_attn.k_proj",
166
- "language_model.layers.11.self_attn.k_proj",
167
- "40.self_attn.k_proj",
 
 
 
 
 
 
168
  "language_model.layers.7.self_attn.q_proj",
169
- "gate_proj",
170
- "language_model.layers.16.self_attn.q_proj",
171
- "language_model.layers.24.self_attn.q_proj",
172
- "language_model.layers.5.self_attn.q_proj",
173
- "language_model.layers.14.self_attn.v_proj",
174
- "language_model.layers.22.self_attn.q_proj",
175
- "language_model.layers.5.self_attn.v_proj",
176
- "41.self_attn.v_proj",
 
 
 
 
 
 
 
 
 
 
 
 
177
  "35.self_attn.v_proj",
178
- "language_model.layers.11.self_attn.v_proj"
 
 
 
 
 
 
179
  ],
180
  "task_type": "CAUSAL_LM",
181
  "trainable_token_indices": null,
 
28
  "rank_pattern": {},
29
  "revision": null,
30
  "target_modules": [
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
31
  "33.self_attn.q_proj",
32
+ "up_proj",
33
+ "language_model.layers.5.self_attn.k_proj",
34
+ "language_model.layers.11.self_attn.v_proj",
35
+ "32.self_attn.k_proj",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
36
  "language_model.layers.26.self_attn.k_proj",
37
+ "38.self_attn.v_proj",
38
+ "36.self_attn.v_proj",
39
+ "39.self_attn.k_proj",
40
+ "language_model.layers.5.self_attn.q_proj",
41
+ "43.self_attn.k_proj",
42
+ "language_model.layers.16.self_attn.v_proj",
43
+ "37.self_attn.q_proj",
44
+ "language_model.layers.20.self_attn.k_proj",
 
 
45
  "language_model.layers.25.self_attn.k_proj",
46
+ "language_model.layers.0.self_attn.k_proj",
47
+ "language_model.layers.8.self_attn.q_proj",
 
 
48
  "42.self_attn.v_proj",
49
+ "38.self_attn.q_proj",
 
 
 
 
 
 
 
50
  "language_model.layers.15.self_attn.v_proj",
51
+ "language_model.layers.11.self_attn.k_proj",
52
+ "language_model.layers.21.self_attn.v_proj",
53
  "45.self_attn.k_proj",
 
 
 
 
 
 
 
54
  "34.self_attn.v_proj",
55
+ "language_model.layers.16.self_attn.q_proj",
56
+ "language_model.layers.24.self_attn.q_proj",
57
+ "language_model.layers.19.self_attn.k_proj",
58
  "34.self_attn.q_proj",
 
 
59
  "language_model.layers.2.self_attn.v_proj",
60
+ "language_model.layers.6.self_attn.v_proj",
61
+ "33.self_attn.k_proj",
62
+ "32.self_attn.v_proj",
63
+ "41.self_attn.v_proj",
64
+ "language_model.layers.14.self_attn.q_proj",
65
+ "language_model.layers.23.self_attn.k_proj",
66
+ "30.self_attn.k_proj",
67
+ "40.self_attn.k_proj",
68
  "39.self_attn.q_proj",
69
+ "language_model.layers.20.self_attn.q_proj",
70
+ "28.self_attn.v_proj",
71
+ "language_model.layers.8.self_attn.k_proj",
72
+ "language_model.layers.9.self_attn.k_proj",
73
+ "47.self_attn.k_proj",
74
+ "gate_proj",
75
  "language_model.layers.2.self_attn.q_proj",
76
+ "language_model.layers.1.self_attn.q_proj",
77
+ "language_model.layers.7.self_attn.k_proj",
78
+ "language_model.layers.5.self_attn.v_proj",
79
+ "30.self_attn.q_proj",
80
+ "language_model.layers.7.self_attn.v_proj",
81
+ "45.self_attn.v_proj",
82
+ "language_model.layers.10.self_attn.q_proj",
83
  "language_model.layers.13.self_attn.k_proj",
84
+ "43.self_attn.v_proj",
85
+ "44.self_attn.k_proj",
86
+ "43.self_attn.q_proj",
87
+ "language_model.layers.2.self_attn.k_proj",
88
+ "language_model.layers.10.self_attn.v_proj",
89
+ "language_model.layers.17.self_attn.k_proj",
90
+ "o_proj",
91
  "language_model.layers.3.self_attn.q_proj",
92
+ "44.self_attn.q_proj",
93
+ "language_model.layers.18.self_attn.k_proj",
94
+ "language_model.layers.25.self_attn.v_proj",
95
+ "45.self_attn.q_proj",
96
+ "language_model.layers.12.self_attn.q_proj",
97
+ "29.self_attn.v_proj",
98
+ "language_model.layers.18.self_attn.v_proj",
99
+ "language_model.layers.15.self_attn.q_proj",
100
+ "down_proj",
101
+ "42.self_attn.q_proj",
102
+ "language_model.layers.8.self_attn.v_proj",
103
  "28.self_attn.k_proj",
104
+ "31.self_attn.q_proj",
 
 
 
105
  "language_model.layers.13.self_attn.q_proj",
106
+ "language_model.layers.1.self_attn.v_proj",
107
+ "31.self_attn.k_proj",
108
+ "language_model.layers.20.self_attn.v_proj",
109
+ "language_model.layers.18.self_attn.q_proj",
110
+ "language_model.layers.23.self_attn.v_proj",
111
+ "language_model.layers.6.self_attn.q_proj",
112
+ "language_model.layers.10.self_attn.k_proj",
113
+ "language_model.layers.26.self_attn.v_proj",
114
+ "40.self_attn.q_proj",
115
+ "36.self_attn.k_proj",
116
+ "language_model.layers.13.self_attn.v_proj",
117
+ "language_model.layers.23.self_attn.q_proj",
118
+ "42.self_attn.k_proj",
119
+ "27.self_attn.v_proj",
120
+ "27.self_attn.k_proj",
121
+ "30.self_attn.v_proj",
122
+ "27.self_attn.q_proj",
123
  "language_model.layers.0.self_attn.q_proj",
124
+ "language_model.layers.0.self_attn.v_proj",
125
+ "31.self_attn.v_proj",
126
+ "language_model.layers.4.self_attn.v_proj",
127
+ "language_model.layers.25.self_attn.q_proj",
128
+ "language_model.layers.22.self_attn.q_proj",
129
+ "language_model.layers.12.self_attn.v_proj",
130
  "33.self_attn.v_proj",
131
+ "37.self_attn.v_proj",
132
+ "41.self_attn.k_proj",
133
+ "language_model.layers.4.self_attn.k_proj",
 
 
 
 
 
 
 
134
  "language_model.layers.17.self_attn.q_proj",
135
+ "language_model.layers.21.self_attn.q_proj",
136
+ "language_model.layers.16.self_attn.k_proj",
137
+ "language_model.layers.6.self_attn.k_proj",
138
+ "46.self_attn.k_proj",
139
+ "language_model.layers.14.self_attn.v_proj",
140
+ "40.self_attn.v_proj",
141
  "38.self_attn.k_proj",
142
+ "language_model.layers.9.self_attn.q_proj",
143
+ "language_model.layers.26.self_attn.q_proj",
144
+ "language_model.layers.24.self_attn.v_proj",
145
+ "29.self_attn.q_proj",
146
+ "41.self_attn.q_proj",
147
+ "language_model.layers.19.self_attn.v_proj",
148
+ "language_model.layers.22.self_attn.v_proj",
149
+ "language_model.layers.21.self_attn.k_proj",
150
  "language_model.layers.7.self_attn.q_proj",
151
+ "32.self_attn.q_proj",
152
+ "language_model.layers.15.self_attn.k_proj",
153
+ "language_model.layers.12.self_attn.k_proj",
154
+ "39.self_attn.v_proj",
155
+ "language_model.layers.9.self_attn.v_proj",
156
+ "35.self_attn.k_proj",
157
+ "language_model.layers.19.self_attn.q_proj",
158
+ "28.self_attn.q_proj",
159
+ "language_model.layers.14.self_attn.k_proj",
160
+ "language_model.layers.3.self_attn.k_proj",
161
+ "language_model.layers.1.self_attn.k_proj",
162
+ "37.self_attn.k_proj",
163
+ "34.self_attn.k_proj",
164
+ "language_model.layers.3.self_attn.v_proj",
165
+ "36.self_attn.q_proj",
166
+ "47.self_attn.v_proj",
167
+ "44.self_attn.v_proj",
168
+ "29.self_attn.k_proj",
169
+ "46.self_attn.q_proj",
170
+ "46.self_attn.v_proj",
171
  "35.self_attn.v_proj",
172
+ "language_model.layers.22.self_attn.k_proj",
173
+ "language_model.layers.11.self_attn.q_proj",
174
+ "language_model.layers.4.self_attn.q_proj",
175
+ "35.self_attn.q_proj",
176
+ "47.self_attn.q_proj",
177
+ "language_model.layers.24.self_attn.k_proj",
178
+ "language_model.layers.17.self_attn.v_proj"
179
  ],
180
  "task_type": "CAUSAL_LM",
181
  "trainable_token_indices": null,
checkpoint-1395/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1a98dbf0225d0bdfaad0af249d68fad53159cddecf45b2ddc7f14abd4b0e7ba1
3
  size 131040264
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:67b732d78c0543831c924f30a3e9f4ece7c9a51233bdd3e7eb43386b23a450d0
3
  size 131040264
checkpoint-1395/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:44afa3b8223494f0737e6042f4e5222962ba0beafa93e8dbf149e6956c0c1ee6
3
- size 3449
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:371bd29df57f0b68f647ef91d63f07f30b6d43adad1b0c06305737ab7fd6f039
3
+ size 262448707
checkpoint-1395/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9a342b0a98c4a7f4d98d7b17d47eaf35d72d591aeb6847e05f9152644dc05f83
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:19035d721a929da85a91bb94cf56d4101c916b8fc2a3f94436a29d093658f249
3
  size 1465
checkpoint-1395/special_tokens_map.json CHANGED
@@ -9,7 +9,7 @@
9
  },
10
  "eoi_token": "<end_of_image>",
11
  "eos_token": {
12
- "content": "<eos>",
13
  "lstrip": false,
14
  "normalized": false,
15
  "rstrip": false,
 
9
  },
10
  "eoi_token": "<end_of_image>",
11
  "eos_token": {
12
+ "content": "<end_of_turn>",
13
  "lstrip": false,
14
  "normalized": false,
15
  "rstrip": false,
checkpoint-1395/tokenizer_config.json CHANGED
@@ -51327,7 +51327,7 @@
51327
  "bos_token": "<bos>",
51328
  "clean_up_tokenization_spaces": false,
51329
  "eoi_token": "<end_of_image>",
51330
- "eos_token": "<eos>",
51331
  "extra_special_tokens": {
51332
  "boi_token": "<start_of_image>",
51333
  "eoi_token": "<end_of_image>",
 
51327
  "bos_token": "<bos>",
51328
  "clean_up_tokenization_spaces": false,
51329
  "eoi_token": "<end_of_image>",
51330
+ "eos_token": "<end_of_turn>",
51331
  "extra_special_tokens": {
51332
  "boi_token": "<start_of_image>",
51333
  "eoi_token": "<end_of_image>",
checkpoint-1395/trainer_state.json CHANGED
@@ -11,1398 +11,1398 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.021528525296017224,
14
- "grad_norm": NaN,
15
- "learning_rate": 3e-05,
16
- "loss": 0.0,
17
- "num_input_tokens_seen": 26560,
18
  "step": 10,
19
- "train_runtime": 72.1053,
20
- "train_tokens_per_second": 368.35
21
  },
22
  {
23
  "epoch": 0.04305705059203445,
24
- "grad_norm": NaN,
25
- "learning_rate": 3e-05,
26
- "loss": 0.0,
27
- "num_input_tokens_seen": 52672,
28
  "step": 20,
29
- "train_runtime": 93.4817,
30
- "train_tokens_per_second": 563.447
31
  },
32
  {
33
  "epoch": 0.06458557588805167,
34
- "grad_norm": NaN,
35
- "learning_rate": 3e-05,
36
- "loss": 0.0,
37
- "num_input_tokens_seen": 79360,
38
  "step": 30,
39
- "train_runtime": 115.1034,
40
- "train_tokens_per_second": 689.467
41
  },
42
  {
43
  "epoch": 0.0861141011840689,
44
- "grad_norm": NaN,
45
- "learning_rate": 3e-05,
46
- "loss": 0.0,
47
- "num_input_tokens_seen": 106432,
48
  "step": 40,
49
- "train_runtime": 136.9811,
50
- "train_tokens_per_second": 776.983
51
  },
52
  {
53
  "epoch": 0.10764262648008611,
54
- "grad_norm": NaN,
55
- "learning_rate": 3e-05,
56
- "loss": 0.0,
57
- "num_input_tokens_seen": 132992,
58
  "step": 50,
59
- "train_runtime": 158.4451,
60
- "train_tokens_per_second": 839.357
61
  },
62
  {
63
  "epoch": 0.12917115177610333,
64
- "grad_norm": NaN,
65
- "learning_rate": 3e-05,
66
- "loss": 0.0,
67
- "num_input_tokens_seen": 159936,
68
  "step": 60,
69
- "train_runtime": 180.1478,
70
- "train_tokens_per_second": 887.804
71
  },
72
  {
73
  "epoch": 0.15069967707212056,
74
- "grad_norm": NaN,
75
- "learning_rate": 3e-05,
76
- "loss": 0.0,
77
- "num_input_tokens_seen": 186624,
78
  "step": 70,
79
- "train_runtime": 201.6103,
80
- "train_tokens_per_second": 925.667
81
  },
82
  {
83
  "epoch": 0.1722282023681378,
84
- "grad_norm": NaN,
85
- "learning_rate": 3e-05,
86
- "loss": 0.0,
87
- "num_input_tokens_seen": 213216,
88
  "step": 80,
89
- "train_runtime": 223.2507,
90
- "train_tokens_per_second": 955.052
91
  },
92
  {
93
  "epoch": 0.193756727664155,
94
- "grad_norm": NaN,
95
- "learning_rate": 3e-05,
96
- "loss": 0.0,
97
- "num_input_tokens_seen": 239328,
98
  "step": 90,
99
- "train_runtime": 244.8417,
100
- "train_tokens_per_second": 977.481
101
  },
102
  {
103
  "epoch": 0.21528525296017223,
104
- "grad_norm": NaN,
105
- "learning_rate": 3e-05,
106
- "loss": 0.0,
107
- "num_input_tokens_seen": 265920,
108
  "step": 100,
109
- "train_runtime": 266.376,
110
- "train_tokens_per_second": 998.288
111
  },
112
  {
113
  "epoch": 0.23681377825618946,
114
- "grad_norm": NaN,
115
- "learning_rate": 3e-05,
116
- "loss": 0.0,
117
- "num_input_tokens_seen": 292288,
118
  "step": 110,
119
- "train_runtime": 287.9016,
120
- "train_tokens_per_second": 1015.236
121
  },
122
  {
123
  "epoch": 0.25834230355220666,
124
- "grad_norm": NaN,
125
- "learning_rate": 3e-05,
126
- "loss": 0.0,
127
- "num_input_tokens_seen": 319264,
128
  "step": 120,
129
- "train_runtime": 309.7609,
130
- "train_tokens_per_second": 1030.679
131
  },
132
  {
133
  "epoch": 0.2798708288482239,
134
- "grad_norm": NaN,
135
- "learning_rate": 3e-05,
136
- "loss": 0.0,
137
- "num_input_tokens_seen": 346144,
138
  "step": 130,
139
- "train_runtime": 331.4402,
140
- "train_tokens_per_second": 1044.363
141
  },
142
  {
143
  "epoch": 0.3013993541442411,
144
- "grad_norm": NaN,
145
- "learning_rate": 3e-05,
146
- "loss": 0.0,
147
- "num_input_tokens_seen": 372800,
148
  "step": 140,
149
- "train_runtime": 353.0058,
150
- "train_tokens_per_second": 1056.073
151
  },
152
  {
153
  "epoch": 0.32292787944025836,
154
- "grad_norm": NaN,
155
- "learning_rate": 3e-05,
156
- "loss": 0.0,
157
- "num_input_tokens_seen": 399552,
158
  "step": 150,
159
- "train_runtime": 374.6224,
160
- "train_tokens_per_second": 1066.546
161
  },
162
  {
163
  "epoch": 0.3444564047362756,
164
- "grad_norm": NaN,
165
- "learning_rate": 3e-05,
166
- "loss": 0.0,
167
- "num_input_tokens_seen": 426464,
168
  "step": 160,
169
- "train_runtime": 396.271,
170
- "train_tokens_per_second": 1076.193
171
  },
172
  {
173
  "epoch": 0.36598493003229277,
174
- "grad_norm": NaN,
175
- "learning_rate": 3e-05,
176
- "loss": 0.0,
177
- "num_input_tokens_seen": 452672,
178
  "step": 170,
179
- "train_runtime": 417.6737,
180
- "train_tokens_per_second": 1083.793
181
  },
182
  {
183
  "epoch": 0.38751345532831,
184
- "grad_norm": NaN,
185
- "learning_rate": 3e-05,
186
- "loss": 0.0,
187
- "num_input_tokens_seen": 479136,
188
  "step": 180,
189
- "train_runtime": 439.2321,
190
- "train_tokens_per_second": 1090.849
191
  },
192
  {
193
  "epoch": 0.40904198062432723,
194
- "grad_norm": NaN,
195
- "learning_rate": 3e-05,
196
- "loss": 0.0,
197
- "num_input_tokens_seen": 505728,
198
  "step": 190,
199
- "train_runtime": 460.7964,
200
- "train_tokens_per_second": 1097.508
201
  },
202
  {
203
  "epoch": 0.43057050592034446,
204
- "grad_norm": NaN,
205
- "learning_rate": 3e-05,
206
- "loss": 0.0,
207
- "num_input_tokens_seen": 532576,
208
  "step": 200,
209
- "train_runtime": 482.3668,
210
- "train_tokens_per_second": 1104.089
211
  },
212
  {
213
  "epoch": 0.4520990312163617,
214
- "grad_norm": NaN,
215
- "learning_rate": 3e-05,
216
- "loss": 0.0,
217
- "num_input_tokens_seen": 559168,
218
  "step": 210,
219
- "train_runtime": 503.9477,
220
- "train_tokens_per_second": 1109.575
221
  },
222
  {
223
  "epoch": 0.4736275565123789,
224
- "grad_norm": NaN,
225
- "learning_rate": 3e-05,
226
- "loss": 0.0,
227
- "num_input_tokens_seen": 586144,
228
  "step": 220,
229
- "train_runtime": 525.6286,
230
- "train_tokens_per_second": 1115.13
231
  },
232
  {
233
  "epoch": 0.4951560818083961,
234
- "grad_norm": NaN,
235
- "learning_rate": 3e-05,
236
- "loss": 0.0,
237
- "num_input_tokens_seen": 612416,
238
  "step": 230,
239
- "train_runtime": 547.0447,
240
- "train_tokens_per_second": 1119.499
241
  },
242
  {
243
  "epoch": 0.5166846071044133,
244
- "grad_norm": NaN,
245
- "learning_rate": 3e-05,
246
- "loss": 0.0,
247
- "num_input_tokens_seen": 639584,
248
  "step": 240,
249
- "train_runtime": 568.7823,
250
- "train_tokens_per_second": 1124.479
251
  },
252
  {
253
  "epoch": 0.5382131324004306,
254
- "grad_norm": NaN,
255
- "learning_rate": 3e-05,
256
- "loss": 0.0,
257
- "num_input_tokens_seen": 665952,
258
  "step": 250,
259
- "train_runtime": 590.0539,
260
- "train_tokens_per_second": 1128.629
261
  },
262
  {
263
  "epoch": 0.5597416576964478,
264
- "grad_norm": NaN,
265
- "learning_rate": 3e-05,
266
- "loss": 0.0,
267
- "num_input_tokens_seen": 693440,
268
  "step": 260,
269
- "train_runtime": 611.9275,
270
- "train_tokens_per_second": 1133.206
271
  },
272
  {
273
  "epoch": 0.581270182992465,
274
- "grad_norm": NaN,
275
- "learning_rate": 3e-05,
276
- "loss": 0.0,
277
- "num_input_tokens_seen": 720128,
278
  "step": 270,
279
- "train_runtime": 633.5076,
280
- "train_tokens_per_second": 1136.731
281
  },
282
  {
283
  "epoch": 0.6027987082884823,
284
- "grad_norm": NaN,
285
- "learning_rate": 3e-05,
286
- "loss": 0.0,
287
- "num_input_tokens_seen": 747360,
288
  "step": 280,
289
- "train_runtime": 655.28,
290
- "train_tokens_per_second": 1140.52
291
  },
292
  {
293
  "epoch": 0.6243272335844995,
294
- "grad_norm": NaN,
295
- "learning_rate": 3e-05,
296
- "loss": 0.0,
297
- "num_input_tokens_seen": 774752,
298
  "step": 290,
299
- "train_runtime": 676.9385,
300
- "train_tokens_per_second": 1144.494
301
  },
302
  {
303
  "epoch": 0.6458557588805167,
304
- "grad_norm": NaN,
305
- "learning_rate": 3e-05,
306
- "loss": 0.0,
307
- "num_input_tokens_seen": 801216,
308
  "step": 300,
309
- "train_runtime": 698.3174,
310
- "train_tokens_per_second": 1147.352
311
  },
312
  {
313
  "epoch": 0.667384284176534,
314
- "grad_norm": NaN,
315
- "learning_rate": 3e-05,
316
- "loss": 0.0,
317
- "num_input_tokens_seen": 827552,
318
  "step": 310,
319
- "train_runtime": 719.7081,
320
- "train_tokens_per_second": 1149.844
321
  },
322
  {
323
  "epoch": 0.6889128094725512,
324
- "grad_norm": NaN,
325
- "learning_rate": 3e-05,
326
- "loss": 0.0,
327
- "num_input_tokens_seen": 854304,
328
  "step": 320,
329
- "train_runtime": 741.3129,
330
- "train_tokens_per_second": 1152.42
331
  },
332
  {
333
  "epoch": 0.7104413347685683,
334
- "grad_norm": NaN,
335
- "learning_rate": 3e-05,
336
- "loss": 0.0,
337
- "num_input_tokens_seen": 881344,
338
  "step": 330,
339
- "train_runtime": 762.9651,
340
- "train_tokens_per_second": 1155.156
341
  },
342
  {
343
  "epoch": 0.7319698600645855,
344
- "grad_norm": NaN,
345
- "learning_rate": 3e-05,
346
- "loss": 0.0,
347
- "num_input_tokens_seen": 907872,
348
  "step": 340,
349
- "train_runtime": 784.4227,
350
- "train_tokens_per_second": 1157.376
351
  },
352
  {
353
  "epoch": 0.7534983853606028,
354
- "grad_norm": NaN,
355
- "learning_rate": 3e-05,
356
- "loss": 0.0,
357
- "num_input_tokens_seen": 935968,
358
  "step": 350,
359
- "train_runtime": 806.8701,
360
- "train_tokens_per_second": 1159.998
361
  },
362
  {
363
  "epoch": 0.77502691065662,
364
- "grad_norm": NaN,
365
- "learning_rate": 3e-05,
366
- "loss": 0.0,
367
- "num_input_tokens_seen": 962816,
368
  "step": 360,
369
- "train_runtime": 828.4786,
370
- "train_tokens_per_second": 1162.15
371
  },
372
  {
373
  "epoch": 0.7965554359526372,
374
- "grad_norm": NaN,
375
- "learning_rate": 3e-05,
376
- "loss": 0.0,
377
- "num_input_tokens_seen": 990848,
378
  "step": 370,
379
- "train_runtime": 850.6384,
380
- "train_tokens_per_second": 1164.829
381
  },
382
  {
383
  "epoch": 0.8180839612486545,
384
- "grad_norm": NaN,
385
- "learning_rate": 3e-05,
386
- "loss": 0.0,
387
- "num_input_tokens_seen": 1017632,
388
  "step": 380,
389
- "train_runtime": 872.1711,
390
- "train_tokens_per_second": 1166.78
391
  },
392
  {
393
  "epoch": 0.8396124865446717,
394
- "grad_norm": NaN,
395
- "learning_rate": 3e-05,
396
- "loss": 0.0,
397
- "num_input_tokens_seen": 1044000,
398
  "step": 390,
399
- "train_runtime": 893.5948,
400
- "train_tokens_per_second": 1168.315
401
  },
402
  {
403
  "epoch": 0.8611410118406889,
404
- "grad_norm": NaN,
405
- "learning_rate": 3e-05,
406
- "loss": 0.0,
407
- "num_input_tokens_seen": 1070240,
408
  "step": 400,
409
- "train_runtime": 914.9469,
410
- "train_tokens_per_second": 1169.729
411
  },
412
  {
413
  "epoch": 0.8826695371367062,
414
- "grad_norm": NaN,
415
- "learning_rate": 3e-05,
416
- "loss": 0.0,
417
- "num_input_tokens_seen": 1097056,
418
  "step": 410,
419
- "train_runtime": 936.5773,
420
- "train_tokens_per_second": 1171.346
421
  },
422
  {
423
  "epoch": 0.9041980624327234,
424
- "grad_norm": NaN,
425
- "learning_rate": 3e-05,
426
- "loss": 0.0,
427
- "num_input_tokens_seen": 1123744,
428
  "step": 420,
429
- "train_runtime": 958.1608,
430
- "train_tokens_per_second": 1172.814
431
  },
432
  {
433
  "epoch": 0.9257265877287406,
434
- "grad_norm": NaN,
435
- "learning_rate": 3e-05,
436
- "loss": 0.0,
437
- "num_input_tokens_seen": 1150432,
438
  "step": 430,
439
- "train_runtime": 979.8442,
440
- "train_tokens_per_second": 1174.097
441
  },
442
  {
443
  "epoch": 0.9472551130247578,
444
- "grad_norm": NaN,
445
- "learning_rate": 3e-05,
446
- "loss": 0.0,
447
- "num_input_tokens_seen": 1175840,
448
  "step": 440,
449
- "train_runtime": 1000.9839,
450
- "train_tokens_per_second": 1174.684
451
  },
452
  {
453
  "epoch": 0.9687836383207751,
454
- "grad_norm": NaN,
455
- "learning_rate": 3e-05,
456
- "loss": 0.0,
457
- "num_input_tokens_seen": 1202496,
458
  "step": 450,
459
- "train_runtime": 1022.4292,
460
- "train_tokens_per_second": 1176.117
461
  },
462
  {
463
  "epoch": 0.9903121636167922,
464
- "grad_norm": NaN,
465
- "learning_rate": 3e-05,
466
- "loss": 0.0,
467
- "num_input_tokens_seen": 1228896,
468
  "step": 460,
469
- "train_runtime": 1043.8998,
470
- "train_tokens_per_second": 1177.216
471
  },
472
  {
473
  "epoch": 1.0107642626480087,
474
- "grad_norm": NaN,
475
- "learning_rate": 3e-05,
476
- "loss": 0.0,
477
- "num_input_tokens_seen": 1254560,
478
  "step": 470,
479
- "train_runtime": 1064.5717,
480
- "train_tokens_per_second": 1178.465
481
  },
482
  {
483
  "epoch": 1.0322927879440258,
484
- "grad_norm": NaN,
485
- "learning_rate": 3e-05,
486
- "loss": 0.0,
487
- "num_input_tokens_seen": 1281024,
488
  "step": 480,
489
- "train_runtime": 1086.0046,
490
- "train_tokens_per_second": 1179.575
491
  },
492
  {
493
  "epoch": 1.0538213132400431,
494
- "grad_norm": NaN,
495
- "learning_rate": 3e-05,
496
- "loss": 0.0,
497
- "num_input_tokens_seen": 1308032,
498
  "step": 490,
499
- "train_runtime": 1108.0344,
500
- "train_tokens_per_second": 1180.498
501
  },
502
  {
503
  "epoch": 1.0753498385360603,
504
- "grad_norm": NaN,
505
- "learning_rate": 3e-05,
506
- "loss": 0.0,
507
- "num_input_tokens_seen": 1335328,
508
  "step": 500,
509
- "train_runtime": 1129.7981,
510
- "train_tokens_per_second": 1181.917
511
  },
512
  {
513
  "epoch": 1.0968783638320776,
514
- "grad_norm": NaN,
515
- "learning_rate": 3e-05,
516
- "loss": 0.0,
517
- "num_input_tokens_seen": 1361888,
518
  "step": 510,
519
- "train_runtime": 1151.3927,
520
- "train_tokens_per_second": 1182.818
521
  },
522
  {
523
  "epoch": 1.1184068891280947,
524
- "grad_norm": NaN,
525
- "learning_rate": 3e-05,
526
- "loss": 0.0,
527
- "num_input_tokens_seen": 1388768,
528
  "step": 520,
529
- "train_runtime": 1173.0032,
530
- "train_tokens_per_second": 1183.942
531
  },
532
  {
533
  "epoch": 1.1399354144241118,
534
- "grad_norm": NaN,
535
- "learning_rate": 3e-05,
536
- "loss": 0.0,
537
- "num_input_tokens_seen": 1414912,
538
  "step": 530,
539
- "train_runtime": 1194.4547,
540
- "train_tokens_per_second": 1184.567
541
  },
542
  {
543
  "epoch": 1.1614639397201292,
544
- "grad_norm": NaN,
545
- "learning_rate": 3e-05,
546
- "loss": 0.0,
547
- "num_input_tokens_seen": 1441440,
548
  "step": 540,
549
- "train_runtime": 1215.9057,
550
- "train_tokens_per_second": 1185.487
551
  },
552
  {
553
  "epoch": 1.1829924650161463,
554
- "grad_norm": NaN,
555
- "learning_rate": 3e-05,
556
- "loss": 0.0,
557
- "num_input_tokens_seen": 1468864,
558
  "step": 550,
559
- "train_runtime": 1237.9092,
560
- "train_tokens_per_second": 1186.568
561
  },
562
  {
563
  "epoch": 1.2045209903121636,
564
- "grad_norm": NaN,
565
- "learning_rate": 3e-05,
566
- "loss": 0.0,
567
- "num_input_tokens_seen": 1495616,
568
  "step": 560,
569
- "train_runtime": 1259.4077,
570
- "train_tokens_per_second": 1187.555
571
  },
572
  {
573
  "epoch": 1.2260495156081808,
574
- "grad_norm": NaN,
575
- "learning_rate": 3e-05,
576
- "loss": 0.0,
577
- "num_input_tokens_seen": 1521856,
578
  "step": 570,
579
- "train_runtime": 1280.8048,
580
- "train_tokens_per_second": 1188.203
581
  },
582
  {
583
  "epoch": 1.247578040904198,
584
- "grad_norm": NaN,
585
- "learning_rate": 3e-05,
586
- "loss": 0.0,
587
- "num_input_tokens_seen": 1548640,
588
  "step": 580,
589
- "train_runtime": 1302.2946,
590
- "train_tokens_per_second": 1189.163
591
  },
592
  {
593
  "epoch": 1.2691065662002152,
594
- "grad_norm": NaN,
595
- "learning_rate": 3e-05,
596
- "loss": 0.0,
597
- "num_input_tokens_seen": 1575040,
598
  "step": 590,
599
- "train_runtime": 1323.6781,
600
- "train_tokens_per_second": 1189.897
601
  },
602
  {
603
  "epoch": 1.2906350914962326,
604
- "grad_norm": NaN,
605
- "learning_rate": 3e-05,
606
- "loss": 0.0,
607
- "num_input_tokens_seen": 1601280,
608
  "step": 600,
609
- "train_runtime": 1345.6098,
610
- "train_tokens_per_second": 1190.003
611
  },
612
  {
613
  "epoch": 1.3121636167922497,
614
- "grad_norm": NaN,
615
- "learning_rate": 3e-05,
616
- "loss": 0.0,
617
- "num_input_tokens_seen": 1628416,
618
  "step": 610,
619
- "train_runtime": 1367.3052,
620
- "train_tokens_per_second": 1190.967
621
  },
622
  {
623
  "epoch": 1.333692142088267,
624
- "grad_norm": NaN,
625
- "learning_rate": 3e-05,
626
- "loss": 0.0,
627
- "num_input_tokens_seen": 1654400,
628
  "step": 620,
629
- "train_runtime": 1388.5516,
630
- "train_tokens_per_second": 1191.457
631
  },
632
  {
633
  "epoch": 1.3552206673842842,
634
- "grad_norm": NaN,
635
- "learning_rate": 3e-05,
636
- "loss": 0.0,
637
- "num_input_tokens_seen": 1681632,
638
  "step": 630,
639
- "train_runtime": 1410.3043,
640
- "train_tokens_per_second": 1192.389
641
  },
642
  {
643
  "epoch": 1.3767491926803013,
644
- "grad_norm": NaN,
645
- "learning_rate": 3e-05,
646
- "loss": 0.0,
647
- "num_input_tokens_seen": 1708480,
648
  "step": 640,
649
- "train_runtime": 1431.8604,
650
- "train_tokens_per_second": 1193.189
651
  },
652
  {
653
  "epoch": 1.3982777179763186,
654
- "grad_norm": NaN,
655
- "learning_rate": 3e-05,
656
- "loss": 0.0,
657
- "num_input_tokens_seen": 1734816,
658
  "step": 650,
659
- "train_runtime": 1453.3567,
660
- "train_tokens_per_second": 1193.662
661
  },
662
  {
663
  "epoch": 1.419806243272336,
664
- "grad_norm": NaN,
665
- "learning_rate": 3e-05,
666
- "loss": 0.0,
667
- "num_input_tokens_seen": 1761248,
668
  "step": 660,
669
- "train_runtime": 1474.9227,
670
- "train_tokens_per_second": 1194.129
671
  },
672
  {
673
  "epoch": 1.441334768568353,
674
- "grad_norm": NaN,
675
- "learning_rate": 3e-05,
676
- "loss": 0.0,
677
- "num_input_tokens_seen": 1788064,
678
  "step": 670,
679
- "train_runtime": 1496.4738,
680
- "train_tokens_per_second": 1194.852
681
  },
682
  {
683
  "epoch": 1.4628632938643702,
684
- "grad_norm": NaN,
685
- "learning_rate": 3e-05,
686
- "loss": 0.0,
687
- "num_input_tokens_seen": 1815360,
688
  "step": 680,
689
- "train_runtime": 1518.1973,
690
- "train_tokens_per_second": 1195.734
691
  },
692
  {
693
  "epoch": 1.4843918191603875,
694
- "grad_norm": NaN,
695
- "learning_rate": 3e-05,
696
- "loss": 0.0,
697
- "num_input_tokens_seen": 1842112,
698
  "step": 690,
699
- "train_runtime": 1539.7277,
700
- "train_tokens_per_second": 1196.388
701
  },
702
  {
703
  "epoch": 1.5059203444564049,
704
- "grad_norm": NaN,
705
- "learning_rate": 3e-05,
706
- "loss": 0.0,
707
- "num_input_tokens_seen": 1868576,
708
  "step": 700,
709
- "train_runtime": 1561.4391,
710
- "train_tokens_per_second": 1196.701
711
  },
712
  {
713
  "epoch": 1.527448869752422,
714
- "grad_norm": NaN,
715
- "learning_rate": 3e-05,
716
- "loss": 0.0,
717
- "num_input_tokens_seen": 1895360,
718
  "step": 710,
719
- "train_runtime": 1583.0746,
720
- "train_tokens_per_second": 1197.265
721
  },
722
  {
723
  "epoch": 1.5489773950484391,
724
- "grad_norm": NaN,
725
- "learning_rate": 3e-05,
726
- "loss": 0.0,
727
- "num_input_tokens_seen": 1922272,
728
  "step": 720,
729
- "train_runtime": 1604.6761,
730
- "train_tokens_per_second": 1197.919
731
  },
732
  {
733
  "epoch": 1.5705059203444565,
734
- "grad_norm": NaN,
735
- "learning_rate": 3e-05,
736
- "loss": 0.0,
737
- "num_input_tokens_seen": 1947936,
738
  "step": 730,
739
- "train_runtime": 1625.9061,
740
- "train_tokens_per_second": 1198.062
741
  },
742
  {
743
  "epoch": 1.5920344456404736,
744
- "grad_norm": NaN,
745
- "learning_rate": 3e-05,
746
- "loss": 0.0,
747
- "num_input_tokens_seen": 1974528,
748
  "step": 740,
749
- "train_runtime": 1647.4063,
750
- "train_tokens_per_second": 1198.568
751
  },
752
  {
753
  "epoch": 1.6135629709364907,
754
- "grad_norm": NaN,
755
- "learning_rate": 3e-05,
756
- "loss": 0.0,
757
- "num_input_tokens_seen": 2001376,
758
  "step": 750,
759
- "train_runtime": 1669.1387,
760
- "train_tokens_per_second": 1199.047
761
  },
762
  {
763
  "epoch": 1.635091496232508,
764
- "grad_norm": NaN,
765
- "learning_rate": 3e-05,
766
- "loss": 0.0,
767
- "num_input_tokens_seen": 2027552,
768
  "step": 760,
769
- "train_runtime": 1690.5608,
770
- "train_tokens_per_second": 1199.337
771
  },
772
  {
773
  "epoch": 1.6566200215285254,
774
- "grad_norm": NaN,
775
- "learning_rate": 3e-05,
776
- "loss": 0.0,
777
- "num_input_tokens_seen": 2054592,
778
  "step": 770,
779
- "train_runtime": 1712.235,
780
- "train_tokens_per_second": 1199.947
781
  },
782
  {
783
  "epoch": 1.6781485468245425,
784
- "grad_norm": NaN,
785
- "learning_rate": 3e-05,
786
- "loss": 0.0,
787
- "num_input_tokens_seen": 2082080,
788
  "step": 780,
789
- "train_runtime": 1734.0681,
790
- "train_tokens_per_second": 1200.691
791
  },
792
  {
793
  "epoch": 1.6996770721205596,
794
- "grad_norm": NaN,
795
- "learning_rate": 3e-05,
796
- "loss": 0.0,
797
- "num_input_tokens_seen": 2107424,
798
  "step": 790,
799
- "train_runtime": 1755.0443,
800
- "train_tokens_per_second": 1200.781
801
  },
802
  {
803
  "epoch": 1.721205597416577,
804
- "grad_norm": NaN,
805
- "learning_rate": 3e-05,
806
- "loss": 0.0,
807
- "num_input_tokens_seen": 2134176,
808
  "step": 800,
809
- "train_runtime": 1776.5164,
810
- "train_tokens_per_second": 1201.326
811
  },
812
  {
813
  "epoch": 1.7427341227125943,
814
- "grad_norm": NaN,
815
- "learning_rate": 3e-05,
816
- "loss": 0.0,
817
- "num_input_tokens_seen": 2161056,
818
  "step": 810,
819
- "train_runtime": 1798.1568,
820
- "train_tokens_per_second": 1201.817
821
  },
822
  {
823
  "epoch": 1.7642626480086114,
824
- "grad_norm": NaN,
825
- "learning_rate": 3e-05,
826
- "loss": 0.0,
827
- "num_input_tokens_seen": 2188064,
828
  "step": 820,
829
- "train_runtime": 1819.7877,
830
- "train_tokens_per_second": 1202.373
831
  },
832
  {
833
  "epoch": 1.7857911733046286,
834
- "grad_norm": NaN,
835
- "learning_rate": 3e-05,
836
- "loss": 0.0,
837
- "num_input_tokens_seen": 2214816,
838
  "step": 830,
839
- "train_runtime": 1841.4354,
840
- "train_tokens_per_second": 1202.766
841
  },
842
  {
843
  "epoch": 1.807319698600646,
844
- "grad_norm": NaN,
845
- "learning_rate": 3e-05,
846
- "loss": 0.0,
847
- "num_input_tokens_seen": 2241984,
848
  "step": 840,
849
- "train_runtime": 1863.1657,
850
- "train_tokens_per_second": 1203.32
851
  },
852
  {
853
  "epoch": 1.8288482238966632,
854
- "grad_norm": NaN,
855
- "learning_rate": 3e-05,
856
- "loss": 0.0,
857
- "num_input_tokens_seen": 2268480,
858
  "step": 850,
859
- "train_runtime": 1884.6464,
860
- "train_tokens_per_second": 1203.663
861
  },
862
  {
863
  "epoch": 1.8503767491926801,
864
- "grad_norm": NaN,
865
- "learning_rate": 3e-05,
866
- "loss": 0.0,
867
- "num_input_tokens_seen": 2295648,
868
  "step": 860,
869
- "train_runtime": 1906.4991,
870
- "train_tokens_per_second": 1204.117
871
  },
872
  {
873
  "epoch": 1.8719052744886975,
874
- "grad_norm": NaN,
875
- "learning_rate": 3e-05,
876
- "loss": 0.0,
877
- "num_input_tokens_seen": 2322752,
878
  "step": 870,
879
- "train_runtime": 1928.2464,
880
- "train_tokens_per_second": 1204.593
881
  },
882
  {
883
  "epoch": 1.8934337997847148,
884
- "grad_norm": NaN,
885
- "learning_rate": 3e-05,
886
- "loss": 0.0,
887
- "num_input_tokens_seen": 2349440,
888
  "step": 880,
889
- "train_runtime": 1949.8363,
890
- "train_tokens_per_second": 1204.942
891
  },
892
  {
893
  "epoch": 1.914962325080732,
894
- "grad_norm": NaN,
895
- "learning_rate": 3e-05,
896
- "loss": 0.0,
897
- "num_input_tokens_seen": 2375744,
898
  "step": 890,
899
- "train_runtime": 1971.2562,
900
- "train_tokens_per_second": 1205.193
901
  },
902
  {
903
  "epoch": 1.936490850376749,
904
- "grad_norm": NaN,
905
- "learning_rate": 3e-05,
906
- "loss": 0.0,
907
- "num_input_tokens_seen": 2401952,
908
  "step": 900,
909
- "train_runtime": 1992.6749,
910
- "train_tokens_per_second": 1205.391
911
  },
912
  {
913
  "epoch": 1.9580193756727664,
914
- "grad_norm": NaN,
915
- "learning_rate": 3e-05,
916
- "loss": 0.0,
917
- "num_input_tokens_seen": 2428384,
918
  "step": 910,
919
- "train_runtime": 2014.3916,
920
- "train_tokens_per_second": 1205.517
921
  },
922
  {
923
  "epoch": 1.9795479009687837,
924
- "grad_norm": NaN,
925
- "learning_rate": 3e-05,
926
- "loss": 0.0,
927
- "num_input_tokens_seen": 2455040,
928
  "step": 920,
929
- "train_runtime": 2036.2422,
930
- "train_tokens_per_second": 1205.672
931
  },
932
  {
933
  "epoch": 2.0,
934
- "grad_norm": NaN,
935
- "learning_rate": 3e-05,
936
- "loss": 0.0,
937
- "num_input_tokens_seen": 2480832,
938
  "step": 930,
939
- "train_runtime": 2057.1,
940
- "train_tokens_per_second": 1205.985
941
  },
942
  {
943
  "epoch": 2.0215285252960173,
944
- "grad_norm": NaN,
945
- "learning_rate": 3e-05,
946
- "loss": 0.0,
947
- "num_input_tokens_seen": 2507296,
948
  "step": 940,
949
- "train_runtime": 2078.6644,
950
- "train_tokens_per_second": 1206.205
951
  },
952
  {
953
  "epoch": 2.0430570505920342,
954
- "grad_norm": NaN,
955
- "learning_rate": 3e-05,
956
- "loss": 0.0,
957
- "num_input_tokens_seen": 2534048,
958
  "step": 950,
959
- "train_runtime": 2100.3618,
960
- "train_tokens_per_second": 1206.482
961
  },
962
  {
963
  "epoch": 2.0645855758880516,
964
- "grad_norm": NaN,
965
- "learning_rate": 3e-05,
966
- "loss": 0.0,
967
- "num_input_tokens_seen": 2560672,
968
  "step": 960,
969
- "train_runtime": 2121.8682,
970
- "train_tokens_per_second": 1206.801
971
  },
972
  {
973
  "epoch": 2.086114101184069,
974
- "grad_norm": NaN,
975
- "learning_rate": 3e-05,
976
- "loss": 0.0,
977
- "num_input_tokens_seen": 2587520,
978
  "step": 970,
979
- "train_runtime": 2143.5225,
980
- "train_tokens_per_second": 1207.135
981
  },
982
  {
983
  "epoch": 2.1076426264800863,
984
- "grad_norm": NaN,
985
- "learning_rate": 3e-05,
986
- "loss": 0.0,
987
- "num_input_tokens_seen": 2614624,
988
  "step": 980,
989
- "train_runtime": 2165.3081,
990
- "train_tokens_per_second": 1207.507
991
  },
992
  {
993
  "epoch": 2.129171151776103,
994
- "grad_norm": NaN,
995
- "learning_rate": 3e-05,
996
- "loss": 0.0,
997
- "num_input_tokens_seen": 2641056,
998
  "step": 990,
999
- "train_runtime": 2186.8029,
1000
- "train_tokens_per_second": 1207.725
1001
  },
1002
  {
1003
  "epoch": 2.1506996770721205,
1004
- "grad_norm": NaN,
1005
- "learning_rate": 3e-05,
1006
- "loss": 0.0,
1007
- "num_input_tokens_seen": 2668128,
1008
  "step": 1000,
1009
- "train_runtime": 2208.4802,
1010
- "train_tokens_per_second": 1208.129
1011
  },
1012
  {
1013
  "epoch": 2.172228202368138,
1014
- "grad_norm": NaN,
1015
- "learning_rate": 3e-05,
1016
- "loss": 0.0,
1017
- "num_input_tokens_seen": 2695040,
1018
  "step": 1010,
1019
- "train_runtime": 2236.0516,
1020
- "train_tokens_per_second": 1205.267
1021
  },
1022
  {
1023
  "epoch": 2.193756727664155,
1024
- "grad_norm": NaN,
1025
- "learning_rate": 3e-05,
1026
- "loss": 0.0,
1027
- "num_input_tokens_seen": 2722176,
1028
  "step": 1020,
1029
- "train_runtime": 2257.7909,
1030
- "train_tokens_per_second": 1205.681
1031
  },
1032
  {
1033
  "epoch": 2.215285252960172,
1034
- "grad_norm": NaN,
1035
- "learning_rate": 3e-05,
1036
- "loss": 0.0,
1037
- "num_input_tokens_seen": 2749120,
1038
  "step": 1030,
1039
- "train_runtime": 2279.4947,
1040
- "train_tokens_per_second": 1206.022
1041
  },
1042
  {
1043
  "epoch": 2.2368137782561894,
1044
- "grad_norm": NaN,
1045
- "learning_rate": 3e-05,
1046
- "loss": 0.0,
1047
- "num_input_tokens_seen": 2776320,
1048
  "step": 1040,
1049
- "train_runtime": 2301.3681,
1050
- "train_tokens_per_second": 1206.378
1051
  },
1052
  {
1053
  "epoch": 2.2583423035522068,
1054
- "grad_norm": NaN,
1055
- "learning_rate": 3e-05,
1056
- "loss": 0.0,
1057
- "num_input_tokens_seen": 2802848,
1058
  "step": 1050,
1059
- "train_runtime": 2322.9409,
1060
- "train_tokens_per_second": 1206.595
1061
  },
1062
  {
1063
  "epoch": 2.2798708288482237,
1064
- "grad_norm": NaN,
1065
- "learning_rate": 3e-05,
1066
- "loss": 0.0,
1067
- "num_input_tokens_seen": 2829216,
1068
  "step": 1060,
1069
- "train_runtime": 2344.4991,
1070
- "train_tokens_per_second": 1206.746
1071
  },
1072
  {
1073
  "epoch": 2.301399354144241,
1074
- "grad_norm": NaN,
1075
- "learning_rate": 3e-05,
1076
- "loss": 0.0,
1077
- "num_input_tokens_seen": 2855456,
1078
  "step": 1070,
1079
- "train_runtime": 2365.869,
1080
- "train_tokens_per_second": 1206.938
1081
  },
1082
  {
1083
  "epoch": 2.3229278794402584,
1084
- "grad_norm": NaN,
1085
- "learning_rate": 3e-05,
1086
- "loss": 0.0,
1087
- "num_input_tokens_seen": 2881760,
1088
  "step": 1080,
1089
- "train_runtime": 2387.3046,
1090
- "train_tokens_per_second": 1207.119
1091
  },
1092
  {
1093
  "epoch": 2.3444564047362757,
1094
- "grad_norm": NaN,
1095
- "learning_rate": 3e-05,
1096
- "loss": 0.0,
1097
- "num_input_tokens_seen": 2909440,
1098
  "step": 1090,
1099
- "train_runtime": 2409.3177,
1100
- "train_tokens_per_second": 1207.578
1101
  },
1102
  {
1103
  "epoch": 2.3659849300322926,
1104
- "grad_norm": NaN,
1105
- "learning_rate": 3e-05,
1106
- "loss": 0.0,
1107
- "num_input_tokens_seen": 2935712,
1108
  "step": 1100,
1109
- "train_runtime": 2430.7541,
1110
- "train_tokens_per_second": 1207.737
1111
  },
1112
  {
1113
  "epoch": 2.38751345532831,
1114
- "grad_norm": NaN,
1115
- "learning_rate": 3e-05,
1116
- "loss": 0.0,
1117
- "num_input_tokens_seen": 2962880,
1118
  "step": 1110,
1119
- "train_runtime": 2452.4619,
1120
- "train_tokens_per_second": 1208.125
1121
  },
1122
  {
1123
  "epoch": 2.4090419806243273,
1124
- "grad_norm": NaN,
1125
- "learning_rate": 3e-05,
1126
- "loss": 0.0,
1127
- "num_input_tokens_seen": 2990080,
1128
  "step": 1120,
1129
- "train_runtime": 2474.4861,
1130
- "train_tokens_per_second": 1208.364
1131
  },
1132
  {
1133
  "epoch": 2.4305705059203446,
1134
- "grad_norm": NaN,
1135
- "learning_rate": 3e-05,
1136
- "loss": 0.0,
1137
- "num_input_tokens_seen": 3016736,
1138
  "step": 1130,
1139
- "train_runtime": 2496.0824,
1140
- "train_tokens_per_second": 1208.588
1141
  },
1142
  {
1143
  "epoch": 2.4520990312163615,
1144
- "grad_norm": NaN,
1145
- "learning_rate": 3e-05,
1146
- "loss": 0.0,
1147
- "num_input_tokens_seen": 3043264,
1148
  "step": 1140,
1149
- "train_runtime": 2517.5928,
1150
- "train_tokens_per_second": 1208.799
1151
  },
1152
  {
1153
  "epoch": 2.473627556512379,
1154
- "grad_norm": NaN,
1155
- "learning_rate": 3e-05,
1156
- "loss": 0.0,
1157
- "num_input_tokens_seen": 3070304,
1158
  "step": 1150,
1159
- "train_runtime": 2539.2269,
1160
- "train_tokens_per_second": 1209.149
1161
  },
1162
  {
1163
  "epoch": 2.495156081808396,
1164
- "grad_norm": NaN,
1165
- "learning_rate": 3e-05,
1166
- "loss": 0.0,
1167
- "num_input_tokens_seen": 3096672,
1168
  "step": 1160,
1169
- "train_runtime": 2560.7665,
1170
- "train_tokens_per_second": 1209.275
1171
  },
1172
  {
1173
  "epoch": 2.5166846071044136,
1174
- "grad_norm": NaN,
1175
- "learning_rate": 3e-05,
1176
- "loss": 0.0,
1177
- "num_input_tokens_seen": 3123232,
1178
  "step": 1170,
1179
- "train_runtime": 2582.3993,
1180
- "train_tokens_per_second": 1209.43
1181
  },
1182
  {
1183
  "epoch": 2.5382131324004304,
1184
- "grad_norm": NaN,
1185
- "learning_rate": 3e-05,
1186
- "loss": 0.0,
1187
- "num_input_tokens_seen": 3149792,
1188
  "step": 1180,
1189
- "train_runtime": 2603.8176,
1190
- "train_tokens_per_second": 1209.682
1191
  },
1192
  {
1193
  "epoch": 2.559741657696448,
1194
- "grad_norm": NaN,
1195
- "learning_rate": 3e-05,
1196
- "loss": 0.0,
1197
- "num_input_tokens_seen": 3177152,
1198
  "step": 1190,
1199
- "train_runtime": 2625.6164,
1200
- "train_tokens_per_second": 1210.059
1201
  },
1202
  {
1203
  "epoch": 2.581270182992465,
1204
- "grad_norm": NaN,
1205
- "learning_rate": 3e-05,
1206
- "loss": 0.0,
1207
- "num_input_tokens_seen": 3203840,
1208
  "step": 1200,
1209
- "train_runtime": 2647.2692,
1210
- "train_tokens_per_second": 1210.243
1211
  },
1212
  {
1213
  "epoch": 2.602798708288482,
1214
- "grad_norm": NaN,
1215
- "learning_rate": 3e-05,
1216
- "loss": 0.0,
1217
- "num_input_tokens_seen": 3230720,
1218
  "step": 1210,
1219
- "train_runtime": 2668.9701,
1220
- "train_tokens_per_second": 1210.474
1221
  },
1222
  {
1223
  "epoch": 2.6243272335844994,
1224
- "grad_norm": NaN,
1225
- "learning_rate": 3e-05,
1226
- "loss": 0.0,
1227
- "num_input_tokens_seen": 3256544,
1228
  "step": 1220,
1229
- "train_runtime": 2690.1588,
1230
- "train_tokens_per_second": 1210.54
1231
  },
1232
  {
1233
  "epoch": 2.6458557588805167,
1234
- "grad_norm": NaN,
1235
- "learning_rate": 3e-05,
1236
- "loss": 0.0,
1237
- "num_input_tokens_seen": 3283136,
1238
  "step": 1230,
1239
- "train_runtime": 2711.6377,
1240
- "train_tokens_per_second": 1210.758
1241
  },
1242
  {
1243
  "epoch": 2.667384284176534,
1244
- "grad_norm": NaN,
1245
- "learning_rate": 3e-05,
1246
- "loss": 0.0,
1247
- "num_input_tokens_seen": 3310464,
1248
  "step": 1240,
1249
- "train_runtime": 2733.5223,
1250
- "train_tokens_per_second": 1211.062
1251
  },
1252
  {
1253
  "epoch": 2.6889128094725514,
1254
- "grad_norm": NaN,
1255
- "learning_rate": 3e-05,
1256
- "loss": 0.0,
1257
- "num_input_tokens_seen": 3336608,
1258
  "step": 1250,
1259
- "train_runtime": 2754.8994,
1260
- "train_tokens_per_second": 1211.154
1261
  },
1262
  {
1263
  "epoch": 2.7104413347685683,
1264
- "grad_norm": NaN,
1265
- "learning_rate": 3e-05,
1266
- "loss": 0.0,
1267
- "num_input_tokens_seen": 3363200,
1268
  "step": 1260,
1269
- "train_runtime": 2776.4685,
1270
- "train_tokens_per_second": 1211.323
1271
  },
1272
  {
1273
  "epoch": 2.7319698600645856,
1274
- "grad_norm": NaN,
1275
- "learning_rate": 3e-05,
1276
- "loss": 0.0,
1277
- "num_input_tokens_seen": 3390176,
1278
  "step": 1270,
1279
- "train_runtime": 2798.1585,
1280
- "train_tokens_per_second": 1211.574
1281
  },
1282
  {
1283
  "epoch": 2.7534983853606025,
1284
- "grad_norm": NaN,
1285
- "learning_rate": 3e-05,
1286
- "loss": 0.0,
1287
- "num_input_tokens_seen": 3416832,
1288
  "step": 1280,
1289
- "train_runtime": 2819.8163,
1290
- "train_tokens_per_second": 1211.721
1291
  },
1292
  {
1293
  "epoch": 2.77502691065662,
1294
- "grad_norm": NaN,
1295
- "learning_rate": 3e-05,
1296
- "loss": 0.0,
1297
- "num_input_tokens_seen": 3443264,
1298
  "step": 1290,
1299
- "train_runtime": 2841.1743,
1300
- "train_tokens_per_second": 1211.916
1301
  },
1302
  {
1303
  "epoch": 2.7965554359526372,
1304
- "grad_norm": NaN,
1305
- "learning_rate": 3e-05,
1306
- "loss": 0.0,
1307
- "num_input_tokens_seen": 3470400,
1308
  "step": 1300,
1309
- "train_runtime": 2862.8952,
1310
- "train_tokens_per_second": 1212.199
1311
  },
1312
  {
1313
  "epoch": 2.8180839612486546,
1314
- "grad_norm": NaN,
1315
- "learning_rate": 3e-05,
1316
- "loss": 0.0,
1317
- "num_input_tokens_seen": 3497440,
1318
  "step": 1310,
1319
- "train_runtime": 2884.5689,
1320
- "train_tokens_per_second": 1212.465
1321
  },
1322
  {
1323
  "epoch": 2.839612486544672,
1324
- "grad_norm": NaN,
1325
- "learning_rate": 3e-05,
1326
- "loss": 0.0,
1327
- "num_input_tokens_seen": 3523968,
1328
  "step": 1320,
1329
- "train_runtime": 2906.0583,
1330
- "train_tokens_per_second": 1212.628
1331
  },
1332
  {
1333
  "epoch": 2.861141011840689,
1334
- "grad_norm": NaN,
1335
- "learning_rate": 3e-05,
1336
- "loss": 0.0,
1337
- "num_input_tokens_seen": 3550816,
1338
  "step": 1330,
1339
- "train_runtime": 2927.5598,
1340
- "train_tokens_per_second": 1212.893
1341
  },
1342
  {
1343
  "epoch": 2.882669537136706,
1344
- "grad_norm": NaN,
1345
- "learning_rate": 3e-05,
1346
- "loss": 0.0,
1347
- "num_input_tokens_seen": 3577248,
1348
  "step": 1340,
1349
- "train_runtime": 2949.1563,
1350
- "train_tokens_per_second": 1212.973
1351
  },
1352
  {
1353
  "epoch": 2.9041980624327235,
1354
- "grad_norm": NaN,
1355
- "learning_rate": 3e-05,
1356
- "loss": 0.0,
1357
- "num_input_tokens_seen": 3603488,
1358
  "step": 1350,
1359
- "train_runtime": 2970.6067,
1360
- "train_tokens_per_second": 1213.048
1361
  },
1362
  {
1363
  "epoch": 2.9257265877287404,
1364
- "grad_norm": NaN,
1365
- "learning_rate": 3e-05,
1366
- "loss": 0.0,
1367
- "num_input_tokens_seen": 3630336,
1368
  "step": 1360,
1369
- "train_runtime": 2992.2294,
1370
- "train_tokens_per_second": 1213.255
1371
  },
1372
  {
1373
  "epoch": 2.9472551130247577,
1374
- "grad_norm": NaN,
1375
- "learning_rate": 3e-05,
1376
- "loss": 0.0,
1377
- "num_input_tokens_seen": 3656832,
1378
  "step": 1370,
1379
- "train_runtime": 3013.8336,
1380
- "train_tokens_per_second": 1213.349
1381
  },
1382
  {
1383
  "epoch": 2.968783638320775,
1384
- "grad_norm": NaN,
1385
- "learning_rate": 3e-05,
1386
- "loss": 0.0,
1387
- "num_input_tokens_seen": 3683488,
1388
  "step": 1380,
1389
- "train_runtime": 3035.3965,
1390
- "train_tokens_per_second": 1213.511
1391
  },
1392
  {
1393
  "epoch": 2.9903121636167924,
1394
- "grad_norm": NaN,
1395
- "learning_rate": 3e-05,
1396
- "loss": 0.0,
1397
- "num_input_tokens_seen": 3710400,
1398
  "step": 1390,
1399
- "train_runtime": 3056.9784,
1400
- "train_tokens_per_second": 1213.748
1401
  }
1402
  ],
1403
  "logging_steps": 10,
1404
  "max_steps": 1395,
1405
- "num_input_tokens_seen": 3722368,
1406
  "num_train_epochs": 3,
1407
  "save_steps": 1000,
1408
  "stateful_callbacks": {
@@ -1417,7 +1417,7 @@
1417
  "attributes": {}
1418
  }
1419
  },
1420
- "total_flos": 2.5033214310893568e+17,
1421
  "train_batch_size": 4,
1422
  "trial_name": null,
1423
  "trial_params": null
 
11
  "log_history": [
12
  {
13
  "epoch": 0.021528525296017224,
14
+ "grad_norm": 16.47992515563965,
15
+ "learning_rate": 9.998973021172564e-06,
16
+ "loss": 1.7834,
17
+ "num_input_tokens_seen": 43648,
18
  "step": 10,
19
+ "train_runtime": 64.3878,
20
+ "train_tokens_per_second": 677.892
21
  },
22
  {
23
  "epoch": 0.04305705059203445,
24
+ "grad_norm": 16.372161865234375,
25
+ "learning_rate": 9.995423512524277e-06,
26
+ "loss": 0.7676,
27
+ "num_input_tokens_seen": 87072,
28
  "step": 20,
29
+ "train_runtime": 95.1979,
30
+ "train_tokens_per_second": 914.642
31
  },
32
  {
33
  "epoch": 0.06458557588805167,
34
+ "grad_norm": 11.686817169189453,
35
+ "learning_rate": 9.98934059499448e-06,
36
+ "loss": 0.5817,
37
+ "num_input_tokens_seen": 131520,
38
  "step": 30,
39
+ "train_runtime": 126.5065,
40
+ "train_tokens_per_second": 1039.63
41
  },
42
  {
43
  "epoch": 0.0861141011840689,
44
+ "grad_norm": 3.2975926399230957,
45
+ "learning_rate": 9.980727353510257e-06,
46
+ "loss": 0.3531,
47
+ "num_input_tokens_seen": 175680,
48
  "step": 40,
49
+ "train_runtime": 157.6702,
50
+ "train_tokens_per_second": 1114.225
51
  },
52
  {
53
  "epoch": 0.10764262648008611,
54
+ "grad_norm": 3.4886627197265625,
55
+ "learning_rate": 9.969588156242282e-06,
56
+ "loss": 0.3352,
57
+ "num_input_tokens_seen": 219584,
58
  "step": 50,
59
+ "train_runtime": 188.7104,
60
+ "train_tokens_per_second": 1163.603
61
  },
62
  {
63
  "epoch": 0.12917115177610333,
64
+ "grad_norm": 3.484487295150757,
65
+ "learning_rate": 9.95592865238951e-06,
66
+ "loss": 0.2298,
67
+ "num_input_tokens_seen": 263392,
68
  "step": 60,
69
+ "train_runtime": 219.7077,
70
+ "train_tokens_per_second": 1198.829
71
  },
72
  {
73
  "epoch": 0.15069967707212056,
74
+ "grad_norm": 4.422971725463867,
75
+ "learning_rate": 9.939755769314215e-06,
76
+ "loss": 0.1981,
77
+ "num_input_tokens_seen": 306912,
78
  "step": 70,
79
+ "train_runtime": 250.6069,
80
+ "train_tokens_per_second": 1224.675
81
  },
82
  {
83
  "epoch": 0.1722282023681378,
84
+ "grad_norm": 1.4185198545455933,
85
+ "learning_rate": 9.9210777090288e-06,
86
+ "loss": 0.1755,
87
+ "num_input_tokens_seen": 349824,
88
  "step": 80,
89
+ "train_runtime": 281.2405,
90
+ "train_tokens_per_second": 1243.86
91
  },
92
  {
93
  "epoch": 0.193756727664155,
94
+ "grad_norm": 1.1935056447982788,
95
+ "learning_rate": 9.899903944036185e-06,
96
+ "loss": 0.1791,
97
+ "num_input_tokens_seen": 393664,
98
  "step": 90,
99
+ "train_runtime": 312.2075,
100
+ "train_tokens_per_second": 1260.905
101
  },
102
  {
103
  "epoch": 0.21528525296017223,
104
+ "grad_norm": 2.463397741317749,
105
+ "learning_rate": 9.87624521252587e-06,
106
+ "loss": 0.2051,
107
+ "num_input_tokens_seen": 437952,
108
  "step": 100,
109
+ "train_runtime": 343.3508,
110
+ "train_tokens_per_second": 1275.523
111
  },
112
  {
113
  "epoch": 0.23681377825618946,
114
+ "grad_norm": 3.8650355339050293,
115
+ "learning_rate": 9.850113512928094e-06,
116
+ "loss": 0.1912,
117
+ "num_input_tokens_seen": 481472,
118
  "step": 110,
119
+ "train_runtime": 374.2539,
120
+ "train_tokens_per_second": 1286.485
121
  },
122
  {
123
  "epoch": 0.25834230355220666,
124
+ "grad_norm": 4.704444885253906,
125
+ "learning_rate": 9.821522097828884e-06,
126
+ "loss": 0.1637,
127
+ "num_input_tokens_seen": 525472,
128
  "step": 120,
129
+ "train_runtime": 405.4374,
130
+ "train_tokens_per_second": 1296.062
131
  },
132
  {
133
  "epoch": 0.2798708288482239,
134
+ "grad_norm": 2.7267754077911377,
135
+ "learning_rate": 9.790485467249065e-06,
136
+ "loss": 0.1537,
137
+ "num_input_tokens_seen": 569696,
138
  "step": 130,
139
+ "train_runtime": 436.4834,
140
+ "train_tokens_per_second": 1305.195
141
  },
142
  {
143
  "epoch": 0.3013993541442411,
144
+ "grad_norm": 3.512826681137085,
145
+ "learning_rate": 9.757019361290621e-06,
146
+ "loss": 0.1846,
147
+ "num_input_tokens_seen": 613760,
148
  "step": 140,
149
+ "train_runtime": 467.5968,
150
+ "train_tokens_per_second": 1312.584
151
  },
152
  {
153
  "epoch": 0.32292787944025836,
154
+ "grad_norm": 2.484517812728882,
155
+ "learning_rate": 9.721140752154182e-06,
156
+ "loss": 0.1872,
157
+ "num_input_tokens_seen": 657824,
158
  "step": 150,
159
+ "train_runtime": 498.6389,
160
+ "train_tokens_per_second": 1319.239
161
  },
162
  {
163
  "epoch": 0.3444564047362756,
164
+ "grad_norm": 2.296607255935669,
165
+ "learning_rate": 9.682867835531624e-06,
166
+ "loss": 0.1372,
167
+ "num_input_tokens_seen": 701760,
168
  "step": 160,
169
+ "train_runtime": 529.7256,
170
+ "train_tokens_per_second": 1324.761
171
  },
172
  {
173
  "epoch": 0.36598493003229277,
174
+ "grad_norm": 3.887946128845215,
175
+ "learning_rate": 9.642220021378212e-06,
176
+ "loss": 0.2028,
177
+ "num_input_tokens_seen": 745184,
178
  "step": 170,
179
+ "train_runtime": 560.5239,
180
+ "train_tokens_per_second": 1329.442
181
  },
182
  {
183
  "epoch": 0.38751345532831,
184
+ "grad_norm": 2.1227307319641113,
185
+ "learning_rate": 9.59921792406891e-06,
186
+ "loss": 0.1765,
187
+ "num_input_tokens_seen": 789216,
188
  "step": 180,
189
+ "train_runtime": 591.5958,
190
+ "train_tokens_per_second": 1334.046
191
  },
192
  {
193
  "epoch": 0.40904198062432723,
194
+ "grad_norm": 3.007882595062256,
195
+ "learning_rate": 9.553883351943882e-06,
196
+ "loss": 0.1882,
197
+ "num_input_tokens_seen": 832960,
198
  "step": 190,
199
+ "train_runtime": 622.6094,
200
+ "train_tokens_per_second": 1337.853
201
  },
202
  {
203
  "epoch": 0.43057050592034446,
204
+ "grad_norm": 1.8637208938598633,
205
+ "learning_rate": 9.506239296248497e-06,
206
+ "loss": 0.1336,
207
+ "num_input_tokens_seen": 877664,
208
  "step": 200,
209
+ "train_runtime": 654.0867,
210
+ "train_tokens_per_second": 1341.816
211
  },
212
  {
213
  "epoch": 0.4520990312163617,
214
+ "grad_norm": 1.1324244737625122,
215
+ "learning_rate": 9.456309919473384e-06,
216
+ "loss": 0.1521,
217
+ "num_input_tokens_seen": 921536,
218
  "step": 210,
219
+ "train_runtime": 685.133,
220
+ "train_tokens_per_second": 1345.047
221
  },
222
  {
223
  "epoch": 0.4736275565123789,
224
+ "grad_norm": 3.536208391189575,
225
+ "learning_rate": 9.404120543100553e-06,
226
+ "loss": 0.1864,
227
+ "num_input_tokens_seen": 965344,
228
  "step": 220,
229
+ "train_runtime": 716.7323,
230
+ "train_tokens_per_second": 1346.868
231
  },
232
  {
233
  "epoch": 0.4951560818083961,
234
+ "grad_norm": 1.73074209690094,
235
+ "learning_rate": 9.34969763476168e-06,
236
+ "loss": 0.1625,
237
+ "num_input_tokens_seen": 1008672,
238
  "step": 230,
239
+ "train_runtime": 747.5266,
240
+ "train_tokens_per_second": 1349.346
241
  },
242
  {
243
  "epoch": 0.5166846071044133,
244
+ "grad_norm": 1.4830386638641357,
245
+ "learning_rate": 9.293068794815175e-06,
246
+ "loss": 0.1456,
247
+ "num_input_tokens_seen": 1051936,
248
  "step": 240,
249
+ "train_runtime": 778.3038,
250
+ "train_tokens_per_second": 1351.575
251
  },
252
  {
253
  "epoch": 0.5382131324004306,
254
+ "grad_norm": 2.7361512184143066,
255
+ "learning_rate": 9.234262742348764e-06,
256
+ "loss": 0.165,
257
+ "num_input_tokens_seen": 1095904,
258
  "step": 250,
259
+ "train_runtime": 809.3485,
260
+ "train_tokens_per_second": 1354.057
261
  },
262
  {
263
  "epoch": 0.5597416576964478,
264
+ "grad_norm": 1.9473741054534912,
265
+ "learning_rate": 9.17330930061471e-06,
266
+ "loss": 0.1487,
267
+ "num_input_tokens_seen": 1140064,
268
  "step": 260,
269
+ "train_runtime": 840.5464,
270
+ "train_tokens_per_second": 1356.337
271
  },
272
  {
273
  "epoch": 0.581270182992465,
274
+ "grad_norm": 2.0610098838806152,
275
+ "learning_rate": 9.11023938190509e-06,
276
+ "loss": 0.1687,
277
+ "num_input_tokens_seen": 1183872,
278
  "step": 270,
279
+ "train_runtime": 871.5774,
280
+ "train_tokens_per_second": 1358.31
281
  },
282
  {
283
  "epoch": 0.6027987082884823,
284
+ "grad_norm": 3.2189598083496094,
285
+ "learning_rate": 9.045084971874738e-06,
286
+ "loss": 0.1511,
287
+ "num_input_tokens_seen": 1228544,
288
  "step": 280,
289
+ "train_runtime": 903.1191,
290
+ "train_tokens_per_second": 1360.334
291
  },
292
  {
293
  "epoch": 0.6243272335844995,
294
+ "grad_norm": 3.902757406234741,
295
+ "learning_rate": 8.977879113319847e-06,
296
+ "loss": 0.184,
297
+ "num_input_tokens_seen": 1271968,
298
  "step": 290,
299
+ "train_runtime": 934.0522,
300
+ "train_tokens_per_second": 1361.774
301
  },
302
  {
303
  "epoch": 0.6458557588805167,
304
+ "grad_norm": 4.2983012199401855,
305
+ "learning_rate": 8.90865588942046e-06,
306
+ "loss": 0.1305,
307
+ "num_input_tokens_seen": 1316096,
308
  "step": 300,
309
+ "train_runtime": 965.1778,
310
+ "train_tokens_per_second": 1363.579
311
  },
312
  {
313
  "epoch": 0.667384284176534,
314
+ "grad_norm": 2.6156394481658936,
315
+ "learning_rate": 8.83745040645531e-06,
316
+ "loss": 0.1405,
317
+ "num_input_tokens_seen": 1360256,
318
  "step": 310,
319
+ "train_runtime": 996.4077,
320
+ "train_tokens_per_second": 1365.16
321
  },
322
  {
323
  "epoch": 0.6889128094725512,
324
+ "grad_norm": 1.3506444692611694,
325
+ "learning_rate": 8.764298775997823e-06,
326
+ "loss": 0.1651,
327
+ "num_input_tokens_seen": 1404064,
328
  "step": 320,
329
+ "train_runtime": 1027.5151,
330
+ "train_tokens_per_second": 1366.466
331
  },
332
  {
333
  "epoch": 0.7104413347685683,
334
+ "grad_norm": 1.5117799043655396,
335
+ "learning_rate": 8.68923809660227e-06,
336
+ "loss": 0.1519,
337
+ "num_input_tokens_seen": 1448256,
338
  "step": 330,
339
+ "train_runtime": 1058.74,
340
+ "train_tokens_per_second": 1367.905
341
  },
342
  {
343
  "epoch": 0.7319698600645855,
344
+ "grad_norm": 1.2659231424331665,
345
+ "learning_rate": 8.612306434989395e-06,
346
+ "loss": 0.1574,
347
+ "num_input_tokens_seen": 1492448,
348
  "step": 340,
349
+ "train_runtime": 1090.0052,
350
+ "train_tokens_per_second": 1369.212
351
  },
352
  {
353
  "epoch": 0.7534983853606028,
354
+ "grad_norm": 2.6010894775390625,
355
+ "learning_rate": 8.53354280674102e-06,
356
+ "loss": 0.1587,
357
+ "num_input_tokens_seen": 1537440,
358
  "step": 350,
359
+ "train_runtime": 1121.55,
360
+ "train_tokens_per_second": 1370.817
361
  },
362
  {
363
  "epoch": 0.77502691065662,
364
+ "grad_norm": 1.6968097686767578,
365
+ "learning_rate": 8.452987156513457e-06,
366
+ "loss": 0.1513,
367
+ "num_input_tokens_seen": 1581280,
368
  "step": 360,
369
+ "train_runtime": 1152.6858,
370
+ "train_tokens_per_second": 1371.822
371
  },
372
  {
373
  "epoch": 0.7965554359526372,
374
+ "grad_norm": 2.0298380851745605,
375
+ "learning_rate": 8.370680337779737e-06,
376
+ "loss": 0.1401,
377
+ "num_input_tokens_seen": 1625824,
378
  "step": 370,
379
+ "train_runtime": 1184.3507,
380
+ "train_tokens_per_second": 1372.756
381
  },
382
  {
383
  "epoch": 0.8180839612486545,
384
+ "grad_norm": 2.7614028453826904,
385
+ "learning_rate": 8.286664092110935e-06,
386
+ "loss": 0.1135,
387
+ "num_input_tokens_seen": 1669472,
388
  "step": 380,
389
+ "train_runtime": 1215.2935,
390
+ "train_tokens_per_second": 1373.719
391
  },
392
  {
393
  "epoch": 0.8396124865446717,
394
+ "grad_norm": 1.6297581195831299,
395
+ "learning_rate": 8.200981028007095e-06,
396
+ "loss": 0.1645,
397
+ "num_input_tokens_seen": 1713312,
398
  "step": 390,
399
+ "train_runtime": 1246.1254,
400
+ "train_tokens_per_second": 1374.911
401
  },
402
  {
403
  "epoch": 0.8611410118406889,
404
+ "grad_norm": 2.32612943649292,
405
+ "learning_rate": 8.11367459928851e-06,
406
+ "loss": 0.1129,
407
+ "num_input_tokens_seen": 1757056,
408
  "step": 400,
409
+ "train_runtime": 1277.0951,
410
+ "train_tokens_per_second": 1375.822
411
  },
412
  {
413
  "epoch": 0.8826695371367062,
414
+ "grad_norm": 1.5576270818710327,
415
+ "learning_rate": 8.024789083058289e-06,
416
+ "loss": 0.1333,
417
+ "num_input_tokens_seen": 1801632,
418
  "step": 410,
419
+ "train_runtime": 1308.5556,
420
+ "train_tokens_per_second": 1376.81
421
  },
422
  {
423
  "epoch": 0.9041980624327234,
424
+ "grad_norm": 8.420344352722168,
425
+ "learning_rate": 7.934369557247397e-06,
426
+ "loss": 0.1311,
427
+ "num_input_tokens_seen": 1845280,
428
  "step": 420,
429
+ "train_runtime": 1339.4668,
430
+ "train_tokens_per_second": 1377.623
431
  },
432
  {
433
  "epoch": 0.9257265877287406,
434
+ "grad_norm": 1.7291479110717773,
435
+ "learning_rate": 7.842461877753575e-06,
436
+ "loss": 0.1395,
437
+ "num_input_tokens_seen": 1889472,
438
  "step": 430,
439
+ "train_runtime": 1370.6369,
440
+ "train_tokens_per_second": 1378.536
441
  },
442
  {
443
  "epoch": 0.9472551130247578,
444
+ "grad_norm": 2.441693067550659,
445
+ "learning_rate": 7.7491126551857e-06,
446
+ "loss": 0.1175,
447
+ "num_input_tokens_seen": 1932832,
448
  "step": 440,
449
+ "train_runtime": 1401.3047,
450
+ "train_tokens_per_second": 1379.309
451
  },
452
  {
453
  "epoch": 0.9687836383207751,
454
+ "grad_norm": 1.3606727123260498,
455
+ "learning_rate": 7.654369231225398e-06,
456
+ "loss": 0.1154,
457
+ "num_input_tokens_seen": 1976000,
458
  "step": 450,
459
+ "train_runtime": 1431.9402,
460
+ "train_tokens_per_second": 1379.946
461
  },
462
  {
463
  "epoch": 0.9903121636167922,
464
+ "grad_norm": 2.911600351333618,
465
+ "learning_rate": 7.5582796546179125e-06,
466
+ "loss": 0.1408,
467
+ "num_input_tokens_seen": 2019968,
468
  "step": 460,
469
+ "train_runtime": 1463.035,
470
+ "train_tokens_per_second": 1380.67
471
  },
472
  {
473
  "epoch": 1.0107642626480087,
474
+ "grad_norm": 2.967047929763794,
475
+ "learning_rate": 7.460892656804366e-06,
476
+ "loss": 0.1126,
477
+ "num_input_tokens_seen": 2061440,
478
  "step": 470,
479
+ "train_runtime": 1492.4083,
480
+ "train_tokens_per_second": 1381.284
481
  },
482
  {
483
  "epoch": 1.0322927879440258,
484
+ "grad_norm": 1.90776789188385,
485
+ "learning_rate": 7.362257627207818e-06,
486
+ "loss": 0.1329,
487
+ "num_input_tokens_seen": 2105216,
488
  "step": 480,
489
+ "train_runtime": 1523.2979,
490
+ "train_tokens_per_second": 1382.012
491
  },
492
  {
493
  "epoch": 1.0538213132400431,
494
+ "grad_norm": 2.7770872116088867,
495
+ "learning_rate": 7.2624245881856094e-06,
496
+ "loss": 0.111,
497
+ "num_input_tokens_seen": 2149888,
498
  "step": 490,
499
+ "train_runtime": 1554.9287,
500
+ "train_tokens_per_second": 1382.628
501
  },
502
  {
503
  "epoch": 1.0753498385360603,
504
+ "grad_norm": 1.9737987518310547,
505
+ "learning_rate": 7.161444169660723e-06,
506
+ "loss": 0.113,
507
+ "num_input_tokens_seen": 2194304,
508
  "step": 500,
509
+ "train_runtime": 1586.2216,
510
+ "train_tokens_per_second": 1383.353
511
  },
512
  {
513
  "epoch": 1.0968783638320776,
514
+ "grad_norm": 1.2335457801818848,
515
+ "learning_rate": 7.059367583445034e-06,
516
+ "loss": 0.1303,
517
+ "num_input_tokens_seen": 2238080,
518
  "step": 510,
519
+ "train_runtime": 1617.0801,
520
+ "train_tokens_per_second": 1384.025
521
  },
522
  {
523
  "epoch": 1.1184068891280947,
524
+ "grad_norm": 2.525258779525757,
525
+ "learning_rate": 6.956246597267438e-06,
526
+ "loss": 0.1404,
527
+ "num_input_tokens_seen": 2282368,
528
  "step": 520,
529
+ "train_runtime": 1648.4109,
530
+ "train_tokens_per_second": 1384.587
531
  },
532
  {
533
  "epoch": 1.1399354144241118,
534
+ "grad_norm": 4.016520977020264,
535
+ "learning_rate": 6.852133508520057e-06,
536
+ "loss": 0.0972,
537
+ "num_input_tokens_seen": 2325984,
538
  "step": 530,
539
+ "train_runtime": 1679.3164,
540
+ "train_tokens_per_second": 1385.078
541
  },
542
  {
543
  "epoch": 1.1614639397201292,
544
+ "grad_norm": 1.405586838722229,
545
+ "learning_rate": 6.747081117735829e-06,
546
+ "loss": 0.1092,
547
+ "num_input_tokens_seen": 2369664,
548
  "step": 540,
549
+ "train_runtime": 1710.2475,
550
+ "train_tokens_per_second": 1385.568
551
  },
552
  {
553
  "epoch": 1.1829924650161463,
554
+ "grad_norm": 2.151442766189575,
555
+ "learning_rate": 6.641142701810932e-06,
556
+ "loss": 0.1186,
557
+ "num_input_tokens_seen": 2413312,
558
  "step": 550,
559
+ "train_runtime": 1741.213,
560
+ "train_tokens_per_second": 1385.995
561
  },
562
  {
563
  "epoch": 1.2045209903121636,
564
+ "grad_norm": 1.9706578254699707,
565
+ "learning_rate": 6.534371986985618e-06,
566
+ "loss": 0.1332,
567
+ "num_input_tokens_seen": 2457120,
568
  "step": 560,
569
+ "train_runtime": 1772.1204,
570
+ "train_tokens_per_second": 1386.542
571
  },
572
  {
573
  "epoch": 1.2260495156081808,
574
+ "grad_norm": 2.3035449981689453,
575
+ "learning_rate": 6.426823121597169e-06,
576
+ "loss": 0.1481,
577
+ "num_input_tokens_seen": 2500736,
578
  "step": 570,
579
+ "train_runtime": 1803.0834,
580
+ "train_tokens_per_second": 1386.922
581
  },
582
  {
583
  "epoch": 1.247578040904198,
584
+ "grad_norm": 3.713632106781006,
585
+ "learning_rate": 6.318550648618785e-06,
586
+ "loss": 0.1332,
587
+ "num_input_tokens_seen": 2545056,
588
  "step": 580,
589
+ "train_runtime": 1834.1935,
590
+ "train_tokens_per_second": 1387.561
591
  },
592
  {
593
  "epoch": 1.2691065662002152,
594
+ "grad_norm": 1.8667478561401367,
595
+ "learning_rate": 6.209609477998339e-06,
596
+ "loss": 0.0978,
597
+ "num_input_tokens_seen": 2588416,
598
  "step": 590,
599
+ "train_runtime": 1864.9784,
600
+ "train_tokens_per_second": 1387.907
601
  },
602
  {
603
  "epoch": 1.2906350914962326,
604
+ "grad_norm": 2.295342445373535,
605
+ "learning_rate": 6.100054858811012e-06,
606
+ "loss": 0.1176,
607
+ "num_input_tokens_seen": 2632352,
608
  "step": 600,
609
+ "train_runtime": 1896.108,
610
+ "train_tokens_per_second": 1388.292
611
  },
612
  {
613
  "epoch": 1.3121636167922497,
614
+ "grad_norm": 2.2867720127105713,
615
+ "learning_rate": 5.989942351239954e-06,
616
+ "loss": 0.1279,
617
+ "num_input_tokens_seen": 2676640,
618
  "step": 610,
619
+ "train_runtime": 1927.5126,
620
+ "train_tokens_per_second": 1388.65
621
  },
622
  {
623
  "epoch": 1.333692142088267,
624
+ "grad_norm": 2.1158223152160645,
625
+ "learning_rate": 5.879327798399155e-06,
626
+ "loss": 0.1407,
627
+ "num_input_tokens_seen": 2719968,
628
  "step": 620,
629
+ "train_runtime": 1958.2576,
630
+ "train_tokens_per_second": 1388.974
631
  },
632
  {
633
  "epoch": 1.3552206673842842,
634
+ "grad_norm": 4.076441287994385,
635
+ "learning_rate": 5.768267298012841e-06,
636
+ "loss": 0.1168,
637
+ "num_input_tokens_seen": 2764352,
638
  "step": 630,
639
+ "train_runtime": 1989.6781,
640
+ "train_tokens_per_second": 1389.346
641
  },
642
  {
643
  "epoch": 1.3767491926803013,
644
+ "grad_norm": 4.354236602783203,
645
+ "learning_rate": 5.656817173965733e-06,
646
+ "loss": 0.1188,
647
+ "num_input_tokens_seen": 2808832,
648
  "step": 640,
649
+ "train_runtime": 2021.0224,
650
+ "train_tokens_per_second": 1389.807
651
  },
652
  {
653
  "epoch": 1.3982777179763186,
654
+ "grad_norm": 4.40167236328125,
655
+ "learning_rate": 5.545033947738624e-06,
656
+ "loss": 0.1326,
657
+ "num_input_tokens_seen": 2852192,
658
  "step": 650,
659
+ "train_runtime": 2051.72,
660
+ "train_tokens_per_second": 1390.147
661
  },
662
  {
663
  "epoch": 1.419806243272336,
664
+ "grad_norm": 2.4845104217529297,
665
+ "learning_rate": 5.4329743097437316e-06,
666
+ "loss": 0.1331,
667
+ "num_input_tokens_seen": 2896256,
668
  "step": 660,
669
+ "train_runtime": 2082.7361,
670
+ "train_tokens_per_second": 1390.602
671
  },
672
  {
673
  "epoch": 1.441334768568353,
674
+ "grad_norm": 2.7233705520629883,
675
+ "learning_rate": 5.320695090574386e-06,
676
+ "loss": 0.1082,
677
+ "num_input_tokens_seen": 2939552,
678
  "step": 670,
679
+ "train_runtime": 2113.5367,
680
+ "train_tokens_per_second": 1390.821
681
  },
682
  {
683
  "epoch": 1.4628632938643702,
684
+ "grad_norm": 3.289949893951416,
685
+ "learning_rate": 5.208253232183625e-06,
686
+ "loss": 0.1184,
687
+ "num_input_tokens_seen": 2984000,
688
  "step": 680,
689
+ "train_runtime": 2144.7931,
690
+ "train_tokens_per_second": 1391.276
691
  },
692
  {
693
  "epoch": 1.4843918191603875,
694
+ "grad_norm": 4.015010833740234,
695
+ "learning_rate": 5.095705759006311e-06,
696
+ "loss": 0.0942,
697
+ "num_input_tokens_seen": 3028192,
698
  "step": 690,
699
+ "train_runtime": 2176.0229,
700
+ "train_tokens_per_second": 1391.618
701
  },
702
  {
703
  "epoch": 1.5059203444564049,
704
+ "grad_norm": 5.474874973297119,
705
+ "learning_rate": 4.9831097490394195e-06,
706
+ "loss": 0.1204,
707
+ "num_input_tokens_seen": 3071392,
708
  "step": 700,
709
+ "train_runtime": 2206.8218,
710
+ "train_tokens_per_second": 1391.772
711
  },
712
  {
713
  "epoch": 1.527448869752422,
714
+ "grad_norm": 2.4211018085479736,
715
+ "learning_rate": 4.870522304895164e-06,
716
+ "loss": 0.1358,
717
+ "num_input_tokens_seen": 3114496,
718
  "step": 710,
719
+ "train_runtime": 2237.5127,
720
+ "train_tokens_per_second": 1391.946
721
  },
722
  {
723
  "epoch": 1.5489773950484391,
724
+ "grad_norm": 2.5446665287017822,
725
+ "learning_rate": 4.758000524841632e-06,
726
+ "loss": 0.1313,
727
+ "num_input_tokens_seen": 3158432,
728
  "step": 720,
729
+ "train_runtime": 2268.6496,
730
+ "train_tokens_per_second": 1392.208
731
  },
732
  {
733
  "epoch": 1.5705059203444565,
734
+ "grad_norm": 5.643487453460693,
735
+ "learning_rate": 4.645601473845636e-06,
736
+ "loss": 0.0879,
737
+ "num_input_tokens_seen": 3201888,
738
  "step": 730,
739
+ "train_runtime": 2299.4823,
740
+ "train_tokens_per_second": 1392.439
741
  },
742
  {
743
  "epoch": 1.5920344456404736,
744
+ "grad_norm": 1.8654100894927979,
745
+ "learning_rate": 4.533382154632442e-06,
746
+ "loss": 0.0977,
747
+ "num_input_tokens_seen": 3245856,
748
  "step": 740,
749
+ "train_runtime": 2330.5679,
750
+ "train_tokens_per_second": 1392.732
751
  },
752
  {
753
  "epoch": 1.6135629709364907,
754
+ "grad_norm": 2.2264926433563232,
755
+ "learning_rate": 4.421399478777064e-06,
756
+ "loss": 0.1483,
757
+ "num_input_tokens_seen": 3290208,
758
  "step": 750,
759
+ "train_runtime": 2361.9169,
760
+ "train_tokens_per_second": 1393.024
761
  },
762
  {
763
  "epoch": 1.635091496232508,
764
+ "grad_norm": 2.8280999660491943,
765
+ "learning_rate": 4.3097102378417985e-06,
766
+ "loss": 0.1285,
767
+ "num_input_tokens_seen": 3333152,
768
  "step": 760,
769
+ "train_runtime": 2392.5926,
770
+ "train_tokens_per_second": 1393.113
771
  },
772
  {
773
  "epoch": 1.6566200215285254,
774
+ "grad_norm": 3.5213840007781982,
775
+ "learning_rate": 4.198371074574597e-06,
776
+ "loss": 0.1475,
777
+ "num_input_tokens_seen": 3377664,
778
  "step": 770,
779
+ "train_runtime": 2423.9491,
780
+ "train_tokens_per_second": 1393.455
781
  },
782
  {
783
  "epoch": 1.6781485468245425,
784
+ "grad_norm": 3.323622226715088,
785
+ "learning_rate": 4.087438454182942e-06,
786
+ "loss": 0.0904,
787
+ "num_input_tokens_seen": 3422400,
788
  "step": 780,
789
+ "train_runtime": 2455.5818,
790
+ "train_tokens_per_second": 1393.723
791
  },
792
  {
793
  "epoch": 1.6996770721205596,
794
+ "grad_norm": 4.368185997009277,
795
+ "learning_rate": 3.976968635697732e-06,
796
+ "loss": 0.1199,
797
+ "num_input_tokens_seen": 3465760,
798
  "step": 790,
799
+ "train_runtime": 2486.3362,
800
+ "train_tokens_per_second": 1393.922
801
  },
802
  {
803
  "epoch": 1.721205597416577,
804
+ "grad_norm": 3.0081822872161865,
805
+ "learning_rate": 3.867017643441746e-06,
806
+ "loss": 0.102,
807
+ "num_input_tokens_seen": 3509760,
808
  "step": 800,
809
+ "train_runtime": 2517.434,
810
+ "train_tokens_per_second": 1394.182
811
  },
812
  {
813
  "epoch": 1.7427341227125943,
814
+ "grad_norm": 3.7257721424102783,
815
+ "learning_rate": 3.757641238617137e-06,
816
+ "loss": 0.1194,
817
+ "num_input_tokens_seen": 3554560,
818
  "step": 810,
819
+ "train_runtime": 2549.4732,
820
+ "train_tokens_per_second": 1394.233
821
  },
822
  {
823
  "epoch": 1.7642626480086114,
824
+ "grad_norm": 3.8365535736083984,
825
+ "learning_rate": 3.648894891026358e-06,
826
+ "loss": 0.1507,
827
+ "num_input_tokens_seen": 3599488,
828
  "step": 820,
829
+ "train_runtime": 2581.0241,
830
+ "train_tokens_per_second": 1394.597
831
  },
832
  {
833
  "epoch": 1.7857911733046286,
834
+ "grad_norm": 2.1309561729431152,
835
+ "learning_rate": 3.5408337509408764e-06,
836
+ "loss": 0.1015,
837
+ "num_input_tokens_seen": 3643680,
838
  "step": 830,
839
+ "train_runtime": 2612.3216,
840
+ "train_tokens_per_second": 1394.805
841
  },
842
  {
843
  "epoch": 1.807319698600646,
844
+ "grad_norm": 2.5082457065582275,
845
+ "learning_rate": 3.4335126211319412e-06,
846
+ "loss": 0.1165,
847
+ "num_input_tokens_seen": 3688160,
848
  "step": 840,
849
+ "train_runtime": 2643.6717,
850
+ "train_tokens_per_second": 1395.09
851
  },
852
  {
853
  "epoch": 1.8288482238966632,
854
+ "grad_norm": 1.4419660568237305,
855
+ "learning_rate": 3.32698592907757e-06,
856
+ "loss": 0.0958,
857
+ "num_input_tokens_seen": 3731392,
858
  "step": 850,
859
+ "train_runtime": 2674.4286,
860
+ "train_tokens_per_second": 1395.211
861
  },
862
  {
863
  "epoch": 1.8503767491926801,
864
+ "grad_norm": 2.402513027191162,
865
+ "learning_rate": 3.2213076993598857e-06,
866
+ "loss": 0.1505,
867
+ "num_input_tokens_seen": 3776128,
868
  "step": 860,
869
+ "train_runtime": 2706.116,
870
+ "train_tokens_per_second": 1395.405
871
  },
872
  {
873
  "epoch": 1.8719052744886975,
874
+ "grad_norm": 0.9779609441757202,
875
+ "learning_rate": 3.1165315262667535e-06,
876
+ "loss": 0.1003,
877
+ "num_input_tokens_seen": 3820896,
878
  "step": 870,
879
+ "train_runtime": 2737.6181,
880
+ "train_tokens_per_second": 1395.701
881
  },
882
  {
883
  "epoch": 1.8934337997847148,
884
+ "grad_norm": 3.727255344390869,
885
+ "learning_rate": 3.012710546611659e-06,
886
+ "loss": 0.1483,
887
+ "num_input_tokens_seen": 3864704,
888
  "step": 880,
889
+ "train_runtime": 2768.6885,
890
+ "train_tokens_per_second": 1395.861
891
  },
892
  {
893
  "epoch": 1.914962325080732,
894
+ "grad_norm": 1.5679094791412354,
895
+ "learning_rate": 2.9098974127856e-06,
896
+ "loss": 0.117,
897
+ "num_input_tokens_seen": 3908544,
898
  "step": 890,
899
+ "train_runtime": 2799.6713,
900
+ "train_tokens_per_second": 1396.072
901
  },
902
  {
903
  "epoch": 1.936490850376749,
904
+ "grad_norm": 2.775408983230591,
905
+ "learning_rate": 2.8081442660546126e-06,
906
+ "loss": 0.1303,
907
+ "num_input_tokens_seen": 3952576,
908
  "step": 900,
909
+ "train_runtime": 2830.9247,
910
+ "train_tokens_per_second": 1396.214
911
  },
912
  {
913
  "epoch": 1.9580193756727664,
914
+ "grad_norm": 1.0387197732925415,
915
+ "learning_rate": 2.7075027101165706e-06,
916
+ "loss": 0.0971,
917
+ "num_input_tokens_seen": 3996416,
918
  "step": 910,
919
+ "train_runtime": 2862.0695,
920
+ "train_tokens_per_second": 1396.338
921
  },
922
  {
923
  "epoch": 1.9795479009687837,
924
+ "grad_norm": 3.794166326522827,
925
+ "learning_rate": 2.6080237849305467e-06,
926
+ "loss": 0.132,
927
+ "num_input_tokens_seen": 4040736,
928
  "step": 920,
929
+ "train_runtime": 2893.2903,
930
+ "train_tokens_per_second": 1396.589
931
  },
932
  {
933
  "epoch": 2.0,
934
+ "grad_norm": 1.547866702079773,
935
+ "learning_rate": 2.5097579408321264e-06,
936
+ "loss": 0.093,
937
+ "num_input_tokens_seen": 4083200,
938
  "step": 930,
939
+ "train_runtime": 2923.2158,
940
+ "train_tokens_per_second": 1396.818
941
  },
942
  {
943
  "epoch": 2.0215285252960173,
944
+ "grad_norm": 3.5177085399627686,
945
+ "learning_rate": 2.4127550129477145e-06,
946
+ "loss": 0.1324,
947
+ "num_input_tokens_seen": 4127040,
948
  "step": 940,
949
+ "train_runtime": 2954.2784,
950
+ "train_tokens_per_second": 1396.971
951
  },
952
  {
953
  "epoch": 2.0430570505920342,
954
+ "grad_norm": 1.8717275857925415,
955
+ "learning_rate": 2.317064195920852e-06,
956
+ "loss": 0.0841,
957
+ "num_input_tokens_seen": 4170816,
958
  "step": 950,
959
+ "train_runtime": 2985.3333,
960
+ "train_tokens_per_second": 1397.102
961
  },
962
  {
963
  "epoch": 2.0645855758880516,
964
+ "grad_norm": 1.233929991722107,
965
+ "learning_rate": 2.2227340189633508e-06,
966
+ "loss": 0.1138,
967
+ "num_input_tokens_seen": 4214272,
968
  "step": 960,
969
+ "train_runtime": 3016.1559,
970
+ "train_tokens_per_second": 1397.233
971
  },
972
  {
973
  "epoch": 2.086114101184069,
974
+ "grad_norm": 1.6053682565689087,
975
+ "learning_rate": 2.1298123212439028e-06,
976
+ "loss": 0.0892,
977
+ "num_input_tokens_seen": 4258592,
978
  "step": 970,
979
+ "train_runtime": 3047.3824,
980
+ "train_tokens_per_second": 1397.459
981
  },
982
  {
983
  "epoch": 2.1076426264800863,
984
+ "grad_norm": 2.4293172359466553,
985
+ "learning_rate": 2.0383462276266347e-06,
986
+ "loss": 0.1277,
987
+ "num_input_tokens_seen": 4302656,
988
  "step": 980,
989
+ "train_runtime": 3078.5923,
990
+ "train_tokens_per_second": 1397.605
991
  },
992
  {
993
  "epoch": 2.129171151776103,
994
+ "grad_norm": 2.0637197494506836,
995
+ "learning_rate": 1.948382124771927e-06,
996
+ "loss": 0.0968,
997
+ "num_input_tokens_seen": 4345888,
998
  "step": 990,
999
+ "train_runtime": 3109.3083,
1000
+ "train_tokens_per_second": 1397.703
1001
  },
1002
  {
1003
  "epoch": 2.1506996770721205,
1004
+ "grad_norm": 3.5659446716308594,
1005
+ "learning_rate": 1.8599656376116026e-06,
1006
+ "loss": 0.1226,
1007
+ "num_input_tokens_seen": 4390528,
1008
  "step": 1000,
1009
+ "train_runtime": 3140.7259,
1010
+ "train_tokens_per_second": 1397.934
1011
  },
1012
  {
1013
  "epoch": 2.172228202368138,
1014
+ "grad_norm": 3.0801503658294678,
1015
+ "learning_rate": 1.773141606210431e-06,
1016
+ "loss": 0.1201,
1017
+ "num_input_tokens_seen": 4434784,
1018
  "step": 1010,
1019
+ "train_runtime": 3178.3674,
1020
+ "train_tokens_per_second": 1395.303
1021
  },
1022
  {
1023
  "epoch": 2.193756727664155,
1024
+ "grad_norm": 2.0641636848449707,
1025
+ "learning_rate": 1.687954063025663e-06,
1026
+ "loss": 0.0966,
1027
+ "num_input_tokens_seen": 4478976,
1028
  "step": 1020,
1029
+ "train_runtime": 3209.6721,
1030
+ "train_tokens_per_second": 1395.462
1031
  },
1032
  {
1033
  "epoch": 2.215285252960172,
1034
+ "grad_norm": 2.951422929763794,
1035
+ "learning_rate": 1.604446210576157e-06,
1036
+ "loss": 0.1143,
1037
+ "num_input_tokens_seen": 4523616,
1038
  "step": 1030,
1039
+ "train_runtime": 3241.2178,
1040
+ "train_tokens_per_second": 1395.653
1041
  },
1042
  {
1043
  "epoch": 2.2368137782561894,
1044
+ "grad_norm": 5.046944618225098,
1045
+ "learning_rate": 1.5226603995323897e-06,
1046
+ "loss": 0.1114,
1047
+ "num_input_tokens_seen": 4567264,
1048
  "step": 1040,
1049
+ "train_runtime": 3272.1686,
1050
+ "train_tokens_per_second": 1395.791
1051
  },
1052
  {
1053
  "epoch": 2.2583423035522068,
1054
+ "grad_norm": 1.3710857629776,
1055
+ "learning_rate": 1.4426381072384866e-06,
1056
+ "loss": 0.0981,
1057
+ "num_input_tokens_seen": 4611104,
1058
  "step": 1050,
1059
+ "train_runtime": 3303.3652,
1060
+ "train_tokens_per_second": 1395.881
1061
  },
1062
  {
1063
  "epoch": 2.2798708288482237,
1064
+ "grad_norm": 2.5878543853759766,
1065
+ "learning_rate": 1.3644199166771531e-06,
1066
+ "loss": 0.1135,
1067
+ "num_input_tokens_seen": 4655040,
1068
  "step": 1060,
1069
+ "train_runtime": 3334.5323,
1070
+ "train_tokens_per_second": 1396.01
1071
  },
1072
  {
1073
  "epoch": 2.301399354144241,
1074
+ "grad_norm": 2.481158494949341,
1075
+ "learning_rate": 1.2880454958881794e-06,
1076
+ "loss": 0.1081,
1077
+ "num_input_tokens_seen": 4698432,
1078
  "step": 1070,
1079
+ "train_runtime": 3365.4557,
1080
+ "train_tokens_per_second": 1396.076
1081
  },
1082
  {
1083
  "epoch": 2.3229278794402584,
1084
+ "grad_norm": 1.2142502069473267,
1085
+ "learning_rate": 1.2135535778509545e-06,
1086
+ "loss": 0.0685,
1087
+ "num_input_tokens_seen": 4742848,
1088
  "step": 1080,
1089
+ "train_runtime": 3396.7938,
1090
+ "train_tokens_per_second": 1396.272
1091
  },
1092
  {
1093
  "epoch": 2.3444564047362757,
1094
+ "grad_norm": 3.040208339691162,
1095
+ "learning_rate": 1.1409819408411898e-06,
1096
+ "loss": 0.0857,
1097
+ "num_input_tokens_seen": 4786944,
1098
  "step": 1090,
1099
+ "train_runtime": 3427.8943,
1100
+ "train_tokens_per_second": 1396.468
1101
  },
1102
  {
1103
  "epoch": 2.3659849300322926,
1104
+ "grad_norm": 1.4514607191085815,
1105
+ "learning_rate": 1.070367389271823e-06,
1106
+ "loss": 0.1008,
1107
+ "num_input_tokens_seen": 4830624,
1108
  "step": 1100,
1109
+ "train_runtime": 3458.8433,
1110
+ "train_tokens_per_second": 1396.601
1111
  },
1112
  {
1113
  "epoch": 2.38751345532831,
1114
+ "grad_norm": 3.533973455429077,
1115
+ "learning_rate": 1.001745735027801e-06,
1116
+ "loss": 0.1137,
1117
+ "num_input_tokens_seen": 4874944,
1118
  "step": 1110,
1119
+ "train_runtime": 3490.3116,
1120
+ "train_tokens_per_second": 1396.707
1121
  },
1122
  {
1123
  "epoch": 2.4090419806243273,
1124
+ "grad_norm": 4.195890426635742,
1125
+ "learning_rate": 9.351517793042408e-07,
1126
+ "loss": 0.1038,
1127
+ "num_input_tokens_seen": 4918496,
1128
  "step": 1120,
1129
+ "train_runtime": 3521.354,
1130
+ "train_tokens_per_second": 1396.763
1131
  },
1132
  {
1133
  "epoch": 2.4305705059203446,
1134
+ "grad_norm": 4.139116287231445,
1135
+ "learning_rate": 8.706192949571262e-07,
1136
+ "loss": 0.1194,
1137
+ "num_input_tokens_seen": 4961920,
1138
  "step": 1130,
1139
+ "train_runtime": 3552.2441,
1140
+ "train_tokens_per_second": 1396.841
1141
  },
1142
  {
1143
  "epoch": 2.4520990312163615,
1144
+ "grad_norm": 3.0998311042785645,
1145
+ "learning_rate": 8.081810093755537e-07,
1146
+ "loss": 0.1161,
1147
+ "num_input_tokens_seen": 5005440,
1148
  "step": 1140,
1149
+ "train_runtime": 3583.1755,
1150
+ "train_tokens_per_second": 1396.928
1151
  },
1152
  {
1153
  "epoch": 2.473627556512379,
1154
+ "grad_norm": 2.2539584636688232,
1155
+ "learning_rate": 7.478685878841629e-07,
1156
+ "loss": 0.1,
1157
+ "num_input_tokens_seen": 5049344,
1158
  "step": 1150,
1159
+ "train_runtime": 3614.3079,
1160
+ "train_tokens_per_second": 1397.043
1161
  },
1162
  {
1163
  "epoch": 2.495156081808396,
1164
+ "grad_norm": 3.1125545501708984,
1165
+ "learning_rate": 6.897126176841978e-07,
1166
+ "loss": 0.0996,
1167
+ "num_input_tokens_seen": 5092896,
1168
  "step": 1160,
1169
+ "train_runtime": 3645.2176,
1170
+ "train_tokens_per_second": 1397.145
1171
  },
1172
  {
1173
  "epoch": 2.5166846071044136,
1174
+ "grad_norm": 3.5130155086517334,
1175
+ "learning_rate": 6.337425923413276e-07,
1176
+ "loss": 0.0944,
1177
+ "num_input_tokens_seen": 5136928,
1178
  "step": 1170,
1179
+ "train_runtime": 3676.3104,
1180
+ "train_tokens_per_second": 1397.305
1181
  },
1182
  {
1183
  "epoch": 2.5382131324004304,
1184
+ "grad_norm": 2.059572696685791,
1185
+ "learning_rate": 5.799868968281075e-07,
1186
+ "loss": 0.08,
1187
+ "num_input_tokens_seen": 5180960,
1188
  "step": 1180,
1189
+ "train_runtime": 3707.5494,
1190
+ "train_tokens_per_second": 1397.408
1191
  },
1192
  {
1193
  "epoch": 2.559741657696448,
1194
+ "grad_norm": 4.341704845428467,
1195
+ "learning_rate": 5.284727931286526e-07,
1196
+ "loss": 0.0962,
1197
+ "num_input_tokens_seen": 5225376,
1198
  "step": 1190,
1199
+ "train_runtime": 3738.9161,
1200
+ "train_tokens_per_second": 1397.564
1201
  },
1202
  {
1203
  "epoch": 2.581270182992465,
1204
+ "grad_norm": 2.8424837589263916,
1205
+ "learning_rate": 4.792264064128327e-07,
1206
+ "loss": 0.094,
1207
+ "num_input_tokens_seen": 5268992,
1208
  "step": 1200,
1209
+ "train_runtime": 3769.9587,
1210
+ "train_tokens_per_second": 1397.626
1211
  },
1212
  {
1213
  "epoch": 2.602798708288482,
1214
+ "grad_norm": 3.76309871673584,
1215
+ "learning_rate": 4.322727117869951e-07,
1216
+ "loss": 0.1005,
1217
+ "num_input_tokens_seen": 5312992,
1218
  "step": 1210,
1219
+ "train_runtime": 3801.0547,
1220
+ "train_tokens_per_second": 1397.768
1221
  },
1222
  {
1223
  "epoch": 2.6243272335844994,
1224
+ "grad_norm": 2.470759153366089,
1225
+ "learning_rate": 3.8763552162794983e-07,
1226
+ "loss": 0.1167,
1227
+ "num_input_tokens_seen": 5356448,
1228
  "step": 1220,
1229
+ "train_runtime": 3831.9201,
1230
+ "train_tokens_per_second": 1397.85
1231
  },
1232
  {
1233
  "epoch": 2.6458557588805167,
1234
+ "grad_norm": 2.948512315750122,
1235
+ "learning_rate": 3.453374735066034e-07,
1236
+ "loss": 0.0907,
1237
+ "num_input_tokens_seen": 5400672,
1238
  "step": 1230,
1239
+ "train_runtime": 3863.178,
1240
+ "train_tokens_per_second": 1397.987
1241
  },
1242
  {
1243
  "epoch": 2.667384284176534,
1244
+ "grad_norm": 2.082956552505493,
1245
+ "learning_rate": 3.054000187074224e-07,
1246
+ "loss": 0.1074,
1247
+ "num_input_tokens_seen": 5444576,
1248
  "step": 1240,
1249
+ "train_runtime": 3894.1783,
1250
+ "train_tokens_per_second": 1398.132
1251
  },
1252
  {
1253
  "epoch": 2.6889128094725514,
1254
+ "grad_norm": 2.035034656524658,
1255
+ "learning_rate": 2.678434113494882e-07,
1256
+ "loss": 0.1128,
1257
+ "num_input_tokens_seen": 5488160,
1258
  "step": 1250,
1259
+ "train_runtime": 3925.0458,
1260
+ "train_tokens_per_second": 1398.241
1261
  },
1262
  {
1263
  "epoch": 2.7104413347685683,
1264
+ "grad_norm": 3.7168209552764893,
1265
+ "learning_rate": 2.326866981147091e-07,
1266
+ "loss": 0.1016,
1267
+ "num_input_tokens_seen": 5532000,
1268
  "step": 1260,
1269
+ "train_runtime": 3956.0804,
1270
+ "train_tokens_per_second": 1398.354
1271
  },
1272
  {
1273
  "epoch": 2.7319698600645856,
1274
+ "grad_norm": 4.349425315856934,
1275
+ "learning_rate": 1.999477085883711e-07,
1276
+ "loss": 0.1052,
1277
+ "num_input_tokens_seen": 5575808,
1278
  "step": 1270,
1279
+ "train_runtime": 3987.1129,
1280
+ "train_tokens_per_second": 1398.458
1281
  },
1282
  {
1283
  "epoch": 2.7534983853606025,
1284
+ "grad_norm": 1.8204060792922974,
1285
+ "learning_rate": 1.6964304621693516e-07,
1286
+ "loss": 0.0918,
1287
+ "num_input_tokens_seen": 5619200,
1288
  "step": 1280,
1289
+ "train_runtime": 4017.8653,
1290
+ "train_tokens_per_second": 1398.554
1291
  },
1292
  {
1293
  "epoch": 2.77502691065662,
1294
+ "grad_norm": 3.752577066421509,
1295
+ "learning_rate": 1.4178807988766419e-07,
1296
+ "loss": 0.109,
1297
+ "num_input_tokens_seen": 5662656,
1298
  "step": 1290,
1299
+ "train_runtime": 4048.795,
1300
+ "train_tokens_per_second": 1398.603
1301
  },
1302
  {
1303
  "epoch": 2.7965554359526372,
1304
+ "grad_norm": 3.749866247177124,
1305
+ "learning_rate": 1.1639693613435921e-07,
1306
+ "loss": 0.1224,
1307
+ "num_input_tokens_seen": 5706656,
1308
  "step": 1300,
1309
+ "train_runtime": 4079.9279,
1310
+ "train_tokens_per_second": 1398.715
1311
  },
1312
  {
1313
  "epoch": 2.8180839612486546,
1314
+ "grad_norm": 2.628767251968384,
1315
+ "learning_rate": 9.348249197313918e-08,
1316
+ "loss": 0.0992,
1317
+ "num_input_tokens_seen": 5751232,
1318
  "step": 1310,
1319
+ "train_runtime": 4111.4798,
1320
+ "train_tokens_per_second": 1398.823
1321
  },
1322
  {
1323
  "epoch": 2.839612486544672,
1324
+ "grad_norm": 0.7992174625396729,
1325
+ "learning_rate": 7.305636837191876e-08,
1326
+ "loss": 0.107,
1327
+ "num_input_tokens_seen": 5794976,
1328
  "step": 1320,
1329
+ "train_runtime": 4142.503,
1330
+ "train_tokens_per_second": 1398.907
1331
  },
1332
  {
1333
  "epoch": 2.861141011840689,
1334
+ "grad_norm": 3.0042312145233154,
1335
+ "learning_rate": 5.512892435687645e-08,
1336
+ "loss": 0.0944,
1337
+ "num_input_tokens_seen": 5838368,
1338
  "step": 1330,
1339
+ "train_runtime": 4173.35,
1340
+ "train_tokens_per_second": 1398.964
1341
  },
1342
  {
1343
  "epoch": 2.882669537136706,
1344
+ "grad_norm": 3.208315134048462,
1345
+ "learning_rate": 3.970925175892093e-08,
1346
+ "loss": 0.0867,
1347
+ "num_input_tokens_seen": 5881984,
1348
  "step": 1340,
1349
+ "train_runtime": 4204.3268,
1350
+ "train_tokens_per_second": 1399.031
1351
  },
1352
  {
1353
  "epoch": 2.9041980624327235,
1354
+ "grad_norm": 3.5772690773010254,
1355
+ "learning_rate": 2.6805170602803297e-08,
1356
+ "loss": 0.1075,
1357
+ "num_input_tokens_seen": 5925664,
1358
  "step": 1350,
1359
+ "train_runtime": 4235.1869,
1360
+ "train_tokens_per_second": 1399.151
1361
  },
1362
  {
1363
  "epoch": 2.9257265877287404,
1364
+ "grad_norm": 3.261751413345337,
1365
+ "learning_rate": 1.6423225141223854e-08,
1366
+ "loss": 0.1042,
1367
+ "num_input_tokens_seen": 5969408,
1368
  "step": 1360,
1369
+ "train_runtime": 4266.2069,
1370
+ "train_tokens_per_second": 1399.231
1371
  },
1372
  {
1373
  "epoch": 2.9472551130247577,
1374
+ "grad_norm": 4.744147300720215,
1375
+ "learning_rate": 8.568680535939177e-09,
1376
+ "loss": 0.0964,
1377
+ "num_input_tokens_seen": 6012576,
1378
  "step": 1370,
1379
+ "train_runtime": 4297.0229,
1380
+ "train_tokens_per_second": 1399.242
1381
  },
1382
  {
1383
  "epoch": 2.968783638320775,
1384
+ "grad_norm": 2.3966517448425293,
1385
+ "learning_rate": 3.2455201875586372e-09,
1386
+ "loss": 0.0922,
1387
+ "num_input_tokens_seen": 6056000,
1388
  "step": 1380,
1389
+ "train_runtime": 4328.462,
1390
+ "train_tokens_per_second": 1399.111
1391
  },
1392
  {
1393
  "epoch": 2.9903121636167924,
1394
+ "grad_norm": 1.2950575351715088,
1395
+ "learning_rate": 4.5644371537756363e-10,
1396
+ "loss": 0.115,
1397
+ "num_input_tokens_seen": 6100192,
1398
  "step": 1390,
1399
+ "train_runtime": 4359.7222,
1400
+ "train_tokens_per_second": 1399.216
1401
  }
1402
  ],
1403
  "logging_steps": 10,
1404
  "max_steps": 1395,
1405
+ "num_input_tokens_seen": 6120032,
1406
  "num_train_epochs": 3,
1407
  "save_steps": 1000,
1408
  "stateful_callbacks": {
 
1417
  "attributes": {}
1418
  }
1419
  },
1420
+ "total_flos": 4.115769119160883e+17,
1421
  "train_batch_size": 4,
1422
  "trial_name": null,
1423
  "trial_params": null
checkpoint-1395/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9c29c975621e6dfe5a87aa7a2dbd3a9fa540f81cbdafb9999ffa93dc268922e3
3
  size 6161
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:57039f57f730004d2db4291a164c9a267ccb02be9b83d34e8933cba3e52ae325
3
  size 6161
llamaboard_config.yaml CHANGED
@@ -5,7 +5,7 @@ top.model_name: Gemma-3-12B-Instruct
5
  top.quantization_bit: '4'
6
  top.quantization_method: bnb
7
  top.rope_scaling: none
8
- top.template: alpaca
9
  train.additional_target: ''
10
  train.apollo_rank: 16
11
  train.apollo_scale: 32
@@ -16,7 +16,7 @@ train.badam_switch_interval: 50
16
  train.badam_switch_mode: ascending
17
  train.badam_update_ratio: 0.05
18
  train.batch_size: 4
19
- train.compute_type: fp16
20
  train.create_new_adapter: false
21
  train.cutoff_len: 2048
22
  train.dataset:
@@ -39,7 +39,7 @@ train.galore_update_interval: 200
39
  train.gradient_accumulation_steps: 2
40
  train.image_max_pixels: 768*768
41
  train.image_min_pixels: 32*32
42
- train.learning_rate: 3e-5
43
  train.logging_steps: 10
44
  train.lora_alpha: 16
45
  train.lora_dropout: 0
 
5
  top.quantization_bit: '4'
6
  top.quantization_method: bnb
7
  top.rope_scaling: none
8
+ top.template: gemma3
9
  train.additional_target: ''
10
  train.apollo_rank: 16
11
  train.apollo_scale: 32
 
16
  train.badam_switch_mode: ascending
17
  train.badam_update_ratio: 0.05
18
  train.batch_size: 4
19
+ train.compute_type: bf16
20
  train.create_new_adapter: false
21
  train.cutoff_len: 2048
22
  train.dataset:
 
39
  train.gradient_accumulation_steps: 2
40
  train.image_max_pixels: 768*768
41
  train.image_min_pixels: 32*32
42
+ train.learning_rate: 1e-5
43
  train.logging_steps: 10
44
  train.lora_alpha: 16
45
  train.lora_dropout: 0
running_log.txt CHANGED
@@ -1,20 +1,20 @@
1
- [INFO|2025-10-18 14:45:46] tokenization_utils_base.py:2023 >> loading file tokenizer.model from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.model
2
 
3
- [INFO|2025-10-18 14:45:46] tokenization_utils_base.py:2023 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.json
4
 
5
- [INFO|2025-10-18 14:45:46] tokenization_utils_base.py:2023 >> loading file added_tokens.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/added_tokens.json
6
 
7
- [INFO|2025-10-18 14:45:46] tokenization_utils_base.py:2023 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/special_tokens_map.json
8
 
9
- [INFO|2025-10-18 14:45:46] tokenization_utils_base.py:2023 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer_config.json
10
 
11
- [INFO|2025-10-18 14:45:46] tokenization_utils_base.py:2023 >> loading file chat_template.jinja from cache at None
12
 
13
- [INFO|2025-10-18 14:45:49] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/processor_config.json
14
 
15
- [INFO|2025-10-18 14:45:49] image_processing_base.py:380 >> loading configuration file preprocessor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/preprocessor_config.json
16
 
17
- [INFO|2025-10-18 14:45:49] image_processing_base.py:433 >> Image processor Gemma3ImageProcessorFast {
18
  "crop_size": null,
19
  "data_format": "channels_first",
20
  "default_to_square": true,
@@ -52,21 +52,21 @@
52
  }
53
 
54
 
55
- [INFO|2025-10-18 14:45:49] tokenization_utils_base.py:2023 >> loading file tokenizer.model from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.model
56
 
57
- [INFO|2025-10-18 14:45:49] tokenization_utils_base.py:2023 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.json
58
 
59
- [INFO|2025-10-18 14:45:49] tokenization_utils_base.py:2023 >> loading file added_tokens.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/added_tokens.json
60
 
61
- [INFO|2025-10-18 14:45:49] tokenization_utils_base.py:2023 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/special_tokens_map.json
62
 
63
- [INFO|2025-10-18 14:45:49] tokenization_utils_base.py:2023 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer_config.json
64
 
65
- [INFO|2025-10-18 14:45:49] tokenization_utils_base.py:2023 >> loading file chat_template.jinja from cache at None
66
 
67
- [INFO|2025-10-18 14:45:51] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/processor_config.json
68
 
69
- [INFO|2025-10-18 14:45:54] processing_utils.py:990 >> Processor Gemma3Processor:
70
  - image_processor: Gemma3ImageProcessorFast {
71
  "crop_size": null,
72
  "data_format": "channels_first",
@@ -7025,15 +7025,17 @@
7025
  }
7026
 
7027
 
7028
- [INFO|2025-10-18 14:45:54] logging.py:143 >> Loading dataset treino_pt_rde3.json...
7029
 
7030
- [INFO|2025-10-18 14:46:07] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/config.json
7031
 
7032
- [INFO|2025-10-18 14:46:07] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
7033
 
7034
- [INFO|2025-10-18 14:46:07] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
7035
 
7036
- [INFO|2025-10-18 14:46:07] configuration_utils.py:770 >> Model config Gemma3Config {
 
 
7037
  "architectures": [
7038
  "Gemma3ForConditionalGeneration"
7039
  ],
@@ -7095,17 +7097,17 @@
7095
  }
7096
 
7097
 
7098
- [INFO|2025-10-18 14:46:07] logging.py:143 >> Quantizing model to 4 bit with bitsandbytes.
7099
 
7100
- [INFO|2025-10-18 14:46:07] logging.py:143 >> KV cache is disabled during training.
7101
 
7102
- [INFO|2025-10-18 14:46:17] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
7103
 
7104
- [INFO|2025-10-18 14:46:17] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
7105
 
7106
- [INFO|2025-10-18 14:46:17] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
7107
 
7108
- [INFO|2025-10-18 14:46:17] configuration_utils.py:770 >> Model config Gemma3Config {
7109
  "architectures": [
7110
  "Gemma3ForConditionalGeneration"
7111
  ],
@@ -7264,13 +7266,13 @@
7264
  }
7265
 
7266
 
7267
- [INFO|2025-10-18 14:46:18] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
7268
 
7269
- [INFO|2025-10-18 14:46:18] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
7270
 
7271
- [INFO|2025-10-18 14:46:18] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
7272
 
7273
- [INFO|2025-10-18 14:46:18] configuration_utils.py:770 >> Model config Gemma3Config {
7274
  "architectures": [
7275
  "Gemma3ForConditionalGeneration"
7276
  ],
@@ -7429,21 +7431,13 @@
7429
  }
7430
 
7431
 
7432
- [INFO|2025-10-18 14:46:19] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unslothai--colabpro/snapshots/234f33d5f3e1d9ad83421f33640cd88474a25025/config.json
7433
-
7434
- [INFO|2025-10-18 14:46:19] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unslothai--repeat/snapshots/7c48478c02f84ed89f149b0815cc0216ee831fb0/config.json
7435
-
7436
- [INFO|2025-10-18 14:46:19] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unslothai--vram-80/snapshots/830433cec98f0aa155f72baba38dc9fe6831d3f3/config.json
7437
-
7438
- [INFO|2025-10-18 14:46:20] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unslothai--1/snapshots/7ec782b7604cd9ea0781c23a4270f031650f5617/config.json
7439
-
7440
- [INFO|2025-10-18 14:46:20] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
7441
 
7442
- [INFO|2025-10-18 14:46:20] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
7443
 
7444
- [INFO|2025-10-18 14:46:20] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
7445
 
7446
- [INFO|2025-10-18 14:46:20] configuration_utils.py:770 >> Model config Gemma3Config {
7447
  "architectures": [
7448
  "Gemma3ForConditionalGeneration"
7449
  ],
@@ -7602,30 +7596,30 @@
7602
  }
7603
 
7604
 
7605
- [INFO|2025-10-18 14:46:20] modeling_utils.py:1151 >> loading weights file model.safetensors from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/model.safetensors.index.json
7606
 
7607
- [INFO|2025-10-18 14:47:22] modeling_utils.py:2241 >> Instantiating Gemma3ForConditionalGeneration model under default dtype torch.bfloat16.
7608
 
7609
- [INFO|2025-10-18 14:47:22] configuration_utils.py:1135 >> Generate config GenerationConfig {
7610
  "bos_token_id": 2,
7611
  "eos_token_id": 106,
7612
  "pad_token_id": 0
7613
  }
7614
 
7615
 
7616
- [INFO|2025-10-18 14:47:24] modeling_utils.py:2241 >> Instantiating SiglipVisionModel model under default dtype torch.bfloat16.
7617
 
7618
- [INFO|2025-10-18 14:47:24] modeling_utils.py:2241 >> Instantiating Gemma3TextModel model under default dtype torch.bfloat16.
7619
 
7620
- [INFO|2025-10-18 14:47:28] modeling_utils.py:5131 >> All model checkpoint weights were used when initializing Gemma3ForConditionalGeneration.
7621
 
7622
 
7623
- [INFO|2025-10-18 14:47:28] modeling_utils.py:5139 >> All the weights of Gemma3ForConditionalGeneration were initialized from the model checkpoint at unsloth/gemma-3-12b-it-unsloth-bnb-4bit.
7624
  If your task is similar to the task the model of the checkpoint was trained on, you can already use Gemma3ForConditionalGeneration for predictions without further training.
7625
 
7626
- [INFO|2025-10-18 14:47:29] configuration_utils.py:1090 >> loading configuration file generation_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/generation_config.json
7627
 
7628
- [INFO|2025-10-18 14:47:29] configuration_utils.py:1135 >> Generate config GenerationConfig {
7629
  "bos_token_id": 2,
7630
  "cache_implementation": "hybrid",
7631
  "do_sample": true,
@@ -7639,11 +7633,11 @@ If your task is similar to the task the model of the checkpoint was trained on,
7639
  }
7640
 
7641
 
7642
- [INFO|2025-10-18 14:47:32] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/processor_config.json
7643
 
7644
- [INFO|2025-10-18 14:47:32] image_processing_base.py:380 >> loading configuration file preprocessor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/preprocessor_config.json
7645
 
7646
- [INFO|2025-10-18 14:47:32] image_processing_base.py:433 >> Image processor Gemma3ImageProcessor {
7647
  "do_convert_rgb": null,
7648
  "do_normalize": true,
7649
  "do_pan_and_scan": null,
@@ -7674,9 +7668,9 @@ If your task is similar to the task the model of the checkpoint was trained on,
7674
  }
7675
 
7676
 
7677
- [INFO|2025-10-18 14:47:37] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/processor_config.json
7678
 
7679
- [INFO|2025-10-18 14:47:39] processing_utils.py:990 >> Processor Gemma3Processor:
7680
  - image_processor: Gemma3ImageProcessor {
7681
  "do_convert_rgb": null,
7682
  "do_normalize": true,
@@ -14628,354 +14622,354 @@ If your task is similar to the task the model of the checkpoint was trained on,
14628
  }
14629
 
14630
 
14631
- [INFO|2025-10-18 14:47:42] logging.py:143 >> Gradient checkpointing enabled.
14632
 
14633
- [INFO|2025-10-18 14:47:42] logging.py:143 >> Casting multimodal projector outputs in torch.float16.
14634
 
14635
- [INFO|2025-10-18 14:47:42] logging.py:143 >> Upcasting trainable params to float32.
14636
 
14637
- [INFO|2025-10-18 14:47:42] logging.py:143 >> Fine-tuning method: LoRA
14638
 
14639
- [INFO|2025-10-18 14:47:42] logging.py:143 >> Found linear modules: k_proj,o_proj,q_proj,up_proj,down_proj,v_proj,gate_proj
14640
 
14641
- [INFO|2025-10-18 14:47:42] logging.py:143 >> Set vision model not trainable: ['vision_tower'].
14642
 
14643
- [INFO|2025-10-18 14:47:42] logging.py:143 >> Set multi model projector not trainable: multi_modal_projector.
14644
 
14645
- [INFO|2025-10-18 14:47:47] logging.py:143 >> trainable params: 32,735,232 || all params: 12,220,060,272 || trainable%: 0.2679
14646
 
14647
- [INFO|2025-10-18 14:47:47] trainer.py:756 >> Using auto half precision backend
14648
 
14649
- [INFO|2025-10-18 14:47:47] trainer.py:2409 >> ***** Running training *****
14650
 
14651
- [INFO|2025-10-18 14:47:47] trainer.py:2410 >> Num examples = 3,716
14652
 
14653
- [INFO|2025-10-18 14:47:47] trainer.py:2411 >> Num Epochs = 3
14654
 
14655
- [INFO|2025-10-18 14:47:47] trainer.py:2412 >> Instantaneous batch size per device = 4
14656
 
14657
- [INFO|2025-10-18 14:47:47] trainer.py:2415 >> Total train batch size (w. parallel, distributed & accumulation) = 8
14658
 
14659
- [INFO|2025-10-18 14:47:47] trainer.py:2416 >> Gradient Accumulation steps = 2
14660
 
14661
- [INFO|2025-10-18 14:47:47] trainer.py:2417 >> Total optimization steps = 1,395
14662
 
14663
- [INFO|2025-10-18 14:47:47] trainer.py:2418 >> Number of trainable parameters = 32,735,232
14664
 
14665
- [WARNING|2025-10-18 14:47:48] logging.py:328 >> `use_cache=True` is incompatible with gradient checkpointing. Setting `use_cache=False`.
14666
 
14667
- [INFO|2025-10-18 14:49:00] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.02, 'throughput': 368.39}
14668
 
14669
- [INFO|2025-10-18 14:49:21] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.04, 'throughput': 563.50}
14670
 
14671
- [INFO|2025-10-18 14:49:43] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.06, 'throughput': 689.52}
14672
 
14673
- [INFO|2025-10-18 14:50:04] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.09, 'throughput': 777.03}
14674
 
14675
- [INFO|2025-10-18 14:50:26] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.11, 'throughput': 839.40}
14676
 
14677
- [INFO|2025-10-18 14:50:48] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.13, 'throughput': 887.84}
14678
 
14679
- [INFO|2025-10-18 14:51:09] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.15, 'throughput': 925.70}
14680
 
14681
- [INFO|2025-10-18 14:51:31] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.17, 'throughput': 955.09}
14682
 
14683
- [INFO|2025-10-18 14:51:52] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.19, 'throughput': 977.51}
14684
 
14685
- [INFO|2025-10-18 14:52:14] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.22, 'throughput': 998.32}
14686
 
14687
- [INFO|2025-10-18 14:52:35] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.24, 'throughput': 1015.26}
14688
 
14689
- [INFO|2025-10-18 14:52:57] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.26, 'throughput': 1030.71}
14690
 
14691
- [INFO|2025-10-18 14:53:19] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.28, 'throughput': 1044.39}
14692
 
14693
- [INFO|2025-10-18 14:53:40] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.30, 'throughput': 1056.10}
14694
 
14695
- [INFO|2025-10-18 14:54:02] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.32, 'throughput': 1066.57}
14696
 
14697
- [INFO|2025-10-18 14:54:24] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.34, 'throughput': 1076.21}
14698
 
14699
- [INFO|2025-10-18 14:54:45] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.37, 'throughput': 1083.81}
14700
 
14701
- [INFO|2025-10-18 14:55:07] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.39, 'throughput': 1090.87}
14702
 
14703
- [INFO|2025-10-18 14:55:28] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.41, 'throughput': 1097.53}
14704
 
14705
- [INFO|2025-10-18 14:55:50] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.43, 'throughput': 1104.11}
14706
 
14707
- [INFO|2025-10-18 14:56:11] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.45, 'throughput': 1109.59}
14708
 
14709
- [INFO|2025-10-18 14:56:33] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.47, 'throughput': 1115.15}
14710
 
14711
- [INFO|2025-10-18 14:56:54] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.50, 'throughput': 1119.52}
14712
 
14713
- [INFO|2025-10-18 14:57:16] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.52, 'throughput': 1124.50}
14714
 
14715
- [INFO|2025-10-18 14:57:37] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.54, 'throughput': 1128.64}
14716
 
14717
- [INFO|2025-10-18 14:57:59] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.56, 'throughput': 1133.22}
14718
 
14719
- [INFO|2025-10-18 14:58:21] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.58, 'throughput': 1136.75}
14720
 
14721
- [INFO|2025-10-18 14:58:43] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.60, 'throughput': 1140.53}
14722
 
14723
- [INFO|2025-10-18 14:59:04] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.62, 'throughput': 1144.51}
14724
 
14725
- [INFO|2025-10-18 14:59:26] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.65, 'throughput': 1147.37}
14726
 
14727
- [INFO|2025-10-18 14:59:47] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.67, 'throughput': 1149.86}
14728
 
14729
- [INFO|2025-10-18 15:00:09] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.69, 'throughput': 1152.43}
14730
 
14731
- [INFO|2025-10-18 15:00:30] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.71, 'throughput': 1155.17}
14732
 
14733
- [INFO|2025-10-18 15:00:52] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.73, 'throughput': 1157.39}
14734
 
14735
- [INFO|2025-10-18 15:01:14] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.75, 'throughput': 1160.01}
14736
 
14737
- [INFO|2025-10-18 15:01:36] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.78, 'throughput': 1162.16}
14738
 
14739
- [INFO|2025-10-18 15:01:58] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.80, 'throughput': 1164.84}
14740
 
14741
- [INFO|2025-10-18 15:02:20] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.82, 'throughput': 1166.79}
14742
 
14743
- [INFO|2025-10-18 15:02:41] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.84, 'throughput': 1168.33}
14744
 
14745
- [INFO|2025-10-18 15:03:02] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.86, 'throughput': 1169.74}
14746
 
14747
- [INFO|2025-10-18 15:03:24] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.88, 'throughput': 1171.36}
14748
 
14749
- [INFO|2025-10-18 15:03:46] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.90, 'throughput': 1172.82}
14750
 
14751
- [INFO|2025-10-18 15:04:07] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.93, 'throughput': 1174.11}
14752
 
14753
- [INFO|2025-10-18 15:04:28] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.95, 'throughput': 1174.69}
14754
 
14755
- [INFO|2025-10-18 15:04:50] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.97, 'throughput': 1176.13}
14756
 
14757
- [INFO|2025-10-18 15:05:11] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 0.99, 'throughput': 1177.23}
14758
 
14759
- [INFO|2025-10-18 15:05:32] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.01, 'throughput': 1178.47}
14760
 
14761
- [INFO|2025-10-18 15:05:53] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.03, 'throughput': 1179.58}
14762
 
14763
- [INFO|2025-10-18 15:06:15] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.05, 'throughput': 1180.51}
14764
 
14765
- [INFO|2025-10-18 15:06:37] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.08, 'throughput': 1181.93}
14766
 
14767
- [INFO|2025-10-18 15:06:59] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.10, 'throughput': 1182.83}
14768
 
14769
- [INFO|2025-10-18 15:07:20] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.12, 'throughput': 1183.95}
14770
 
14771
- [INFO|2025-10-18 15:07:42] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.14, 'throughput': 1184.58}
14772
 
14773
- [INFO|2025-10-18 15:08:03] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.16, 'throughput': 1185.49}
14774
 
14775
- [INFO|2025-10-18 15:08:25] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.18, 'throughput': 1186.58}
14776
 
14777
- [INFO|2025-10-18 15:08:47] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.20, 'throughput': 1187.56}
14778
 
14779
- [INFO|2025-10-18 15:09:08] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.23, 'throughput': 1188.21}
14780
 
14781
- [INFO|2025-10-18 15:09:30] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.25, 'throughput': 1189.17}
14782
 
14783
- [INFO|2025-10-18 15:09:51] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.27, 'throughput': 1189.90}
14784
 
14785
- [INFO|2025-10-18 15:10:13] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.29, 'throughput': 1190.01}
14786
 
14787
- [INFO|2025-10-18 15:10:35] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.31, 'throughput': 1190.97}
14788
 
14789
- [INFO|2025-10-18 15:10:56] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.33, 'throughput': 1191.46}
14790
 
14791
- [INFO|2025-10-18 15:11:18] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.36, 'throughput': 1192.40}
14792
 
14793
- [INFO|2025-10-18 15:11:39] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.38, 'throughput': 1193.20}
14794
 
14795
- [INFO|2025-10-18 15:12:01] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.40, 'throughput': 1193.67}
14796
 
14797
- [INFO|2025-10-18 15:12:22] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.42, 'throughput': 1194.14}
14798
 
14799
- [INFO|2025-10-18 15:12:44] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.44, 'throughput': 1194.86}
14800
 
14801
- [INFO|2025-10-18 15:13:06] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.46, 'throughput': 1195.74}
14802
 
14803
- [INFO|2025-10-18 15:13:27] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.48, 'throughput': 1196.39}
14804
 
14805
- [INFO|2025-10-18 15:13:49] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.51, 'throughput': 1196.71}
14806
 
14807
- [INFO|2025-10-18 15:14:10] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.53, 'throughput': 1197.27}
14808
 
14809
- [INFO|2025-10-18 15:14:32] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.55, 'throughput': 1197.93}
14810
 
14811
- [INFO|2025-10-18 15:14:53] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.57, 'throughput': 1198.07}
14812
 
14813
- [INFO|2025-10-18 15:15:15] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.59, 'throughput': 1198.57}
14814
 
14815
- [INFO|2025-10-18 15:15:37] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.61, 'throughput': 1199.05}
14816
 
14817
- [INFO|2025-10-18 15:15:58] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.64, 'throughput': 1199.34}
14818
 
14819
- [INFO|2025-10-18 15:16:20] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.66, 'throughput': 1199.95}
14820
 
14821
- [INFO|2025-10-18 15:16:41] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.68, 'throughput': 1200.70}
14822
 
14823
- [INFO|2025-10-18 15:17:02] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.70, 'throughput': 1200.79}
14824
 
14825
- [INFO|2025-10-18 15:17:24] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.72, 'throughput': 1201.33}
14826
 
14827
- [INFO|2025-10-18 15:17:46] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.74, 'throughput': 1201.82}
14828
 
14829
- [INFO|2025-10-18 15:18:07] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.76, 'throughput': 1202.38}
14830
 
14831
- [INFO|2025-10-18 15:18:29] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.79, 'throughput': 1202.77}
14832
 
14833
- [INFO|2025-10-18 15:18:51] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.81, 'throughput': 1203.32}
14834
 
14835
- [INFO|2025-10-18 15:19:12] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.83, 'throughput': 1203.67}
14836
 
14837
- [INFO|2025-10-18 15:19:34] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.85, 'throughput': 1204.12}
14838
 
14839
- [INFO|2025-10-18 15:19:56] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.87, 'throughput': 1204.60}
14840
 
14841
- [INFO|2025-10-18 15:20:17] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.89, 'throughput': 1204.95}
14842
 
14843
- [INFO|2025-10-18 15:20:39] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.91, 'throughput': 1205.20}
14844
 
14845
- [INFO|2025-10-18 15:21:00] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.94, 'throughput': 1205.40}
14846
 
14847
- [INFO|2025-10-18 15:21:22] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.96, 'throughput': 1205.52}
14848
 
14849
- [INFO|2025-10-18 15:21:44] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 1.98, 'throughput': 1205.68}
14850
 
14851
- [INFO|2025-10-18 15:22:04] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.00, 'throughput': 1205.99}
14852
 
14853
- [INFO|2025-10-18 15:22:26] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.02, 'throughput': 1206.21}
14854
 
14855
- [INFO|2025-10-18 15:22:48] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.04, 'throughput': 1206.49}
14856
 
14857
- [INFO|2025-10-18 15:23:09] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.06, 'throughput': 1206.81}
14858
 
14859
- [INFO|2025-10-18 15:23:31] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.09, 'throughput': 1207.14}
14860
 
14861
- [INFO|2025-10-18 15:23:53] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.11, 'throughput': 1207.51}
14862
 
14863
- [INFO|2025-10-18 15:24:14] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.13, 'throughput': 1207.73}
14864
 
14865
- [INFO|2025-10-18 15:24:36] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.15, 'throughput': 1208.13}
14866
 
14867
- [INFO|2025-10-18 15:24:36] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000
14868
 
14869
- [INFO|2025-10-18 15:24:37] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/preprocessor_config.json
14870
 
14871
- [INFO|2025-10-18 15:24:40] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/chat_template.jinja
14872
 
14873
- [INFO|2025-10-18 15:24:42] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/processor_config.json
14874
 
14875
- [INFO|2025-10-18 15:25:03] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.17, 'throughput': 1205.27}
14876
 
14877
- [INFO|2025-10-18 15:25:25] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.19, 'throughput': 1205.69}
14878
 
14879
- [INFO|2025-10-18 15:25:47] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.22, 'throughput': 1206.03}
14880
 
14881
- [INFO|2025-10-18 15:26:09] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.24, 'throughput': 1206.38}
14882
 
14883
- [INFO|2025-10-18 15:26:30] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.26, 'throughput': 1206.60}
14884
 
14885
- [INFO|2025-10-18 15:26:52] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.28, 'throughput': 1206.75}
14886
 
14887
- [INFO|2025-10-18 15:27:13] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.30, 'throughput': 1206.94}
14888
 
14889
- [INFO|2025-10-18 15:27:35] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.32, 'throughput': 1207.12}
14890
 
14891
- [INFO|2025-10-18 15:27:57] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.34, 'throughput': 1207.58}
14892
 
14893
- [INFO|2025-10-18 15:28:18] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.37, 'throughput': 1207.74}
14894
 
14895
- [INFO|2025-10-18 15:28:40] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.39, 'throughput': 1208.13}
14896
 
14897
- [INFO|2025-10-18 15:29:02] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.41, 'throughput': 1208.37}
14898
 
14899
- [INFO|2025-10-18 15:29:23] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.43, 'throughput': 1208.59}
14900
 
14901
- [INFO|2025-10-18 15:29:45] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.45, 'throughput': 1208.80}
14902
 
14903
- [INFO|2025-10-18 15:30:07] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.47, 'throughput': 1209.15}
14904
 
14905
- [INFO|2025-10-18 15:30:28] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.50, 'throughput': 1209.28}
14906
 
14907
- [INFO|2025-10-18 15:30:50] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.52, 'throughput': 1209.43}
14908
 
14909
- [INFO|2025-10-18 15:31:11] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.54, 'throughput': 1209.69}
14910
 
14911
- [INFO|2025-10-18 15:31:33] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.56, 'throughput': 1210.06}
14912
 
14913
- [INFO|2025-10-18 15:31:55] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.58, 'throughput': 1210.25}
14914
 
14915
- [INFO|2025-10-18 15:32:16] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.60, 'throughput': 1210.48}
14916
 
14917
- [INFO|2025-10-18 15:32:38] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.62, 'throughput': 1210.54}
14918
 
14919
- [INFO|2025-10-18 15:32:59] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.65, 'throughput': 1210.76}
14920
 
14921
- [INFO|2025-10-18 15:33:21] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.67, 'throughput': 1211.07}
14922
 
14923
- [INFO|2025-10-18 15:33:42] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.69, 'throughput': 1211.16}
14924
 
14925
- [INFO|2025-10-18 15:34:04] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.71, 'throughput': 1211.33}
14926
 
14927
- [INFO|2025-10-18 15:34:26] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.73, 'throughput': 1211.58}
14928
 
14929
- [INFO|2025-10-18 15:34:47] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.75, 'throughput': 1211.72}
14930
 
14931
- [INFO|2025-10-18 15:35:09] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.78, 'throughput': 1211.92}
14932
 
14933
- [INFO|2025-10-18 15:35:30] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.80, 'throughput': 1212.20}
14934
 
14935
- [INFO|2025-10-18 15:35:52] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.82, 'throughput': 1212.47}
14936
 
14937
- [INFO|2025-10-18 15:36:13] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.84, 'throughput': 1212.63}
14938
 
14939
- [INFO|2025-10-18 15:36:35] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.86, 'throughput': 1212.90}
14940
 
14941
- [INFO|2025-10-18 15:36:57] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.88, 'throughput': 1212.98}
14942
 
14943
- [INFO|2025-10-18 15:37:18] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.90, 'throughput': 1213.05}
14944
 
14945
- [INFO|2025-10-18 15:37:40] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.93, 'throughput': 1213.26}
14946
 
14947
- [INFO|2025-10-18 15:38:01] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.95, 'throughput': 1213.35}
14948
 
14949
- [INFO|2025-10-18 15:38:23] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.97, 'throughput': 1213.51}
14950
 
14951
- [INFO|2025-10-18 15:38:44] logging.py:143 >> {'loss': 0.0000, 'learning_rate': 3.0000e-05, 'epoch': 2.99, 'throughput': 1213.75}
14952
 
14953
- [INFO|2025-10-18 15:38:54] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395
14954
 
14955
- [INFO|2025-10-18 15:38:55] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/preprocessor_config.json
14956
 
14957
- [INFO|2025-10-18 15:38:58] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/chat_template.jinja
14958
 
14959
- [INFO|2025-10-18 15:39:00] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/processor_config.json
14960
 
14961
- [INFO|2025-10-18 15:39:00] trainer.py:2676 >>
14962
 
14963
  Training completed. Do not forget to share your model on huggingface.co/models =)
14964
 
14965
 
14966
 
14967
- [INFO|2025-10-18 15:39:00] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/preprocessor_config.json
14968
 
14969
- [INFO|2025-10-18 15:39:02] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/chat_template.jinja
14970
 
14971
- [INFO|2025-10-18 15:39:05] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/processor_config.json
14972
 
14973
- [INFO|2025-10-18 15:39:05] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado
14974
 
14975
- [WARNING|2025-10-18 15:39:06] logging.py:148 >> No metric eval_loss to plot.
14976
 
14977
- [WARNING|2025-10-18 15:39:06] logging.py:148 >> No metric eval_accuracy to plot.
14978
 
14979
- [INFO|2025-10-18 15:39:06] modelcard.py:450 >> Dropping the following result as it does not have all the necessary fields:
14980
  {'task': {'name': 'Causal Language Modeling', 'type': 'text-generation'}}
14981
 
 
1
+ [INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file tokenizer.model from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.model
2
 
3
+ [INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.json
4
 
5
+ [INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file added_tokens.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/added_tokens.json
6
 
7
+ [INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/special_tokens_map.json
8
 
9
+ [INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer_config.json
10
 
11
+ [INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file chat_template.jinja from cache at None
12
 
13
+ [INFO|2025-10-27 03:13:22] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/processor_config.json
14
 
15
+ [INFO|2025-10-27 03:13:22] image_processing_base.py:380 >> loading configuration file preprocessor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/preprocessor_config.json
16
 
17
+ [INFO|2025-10-27 03:13:22] image_processing_base.py:433 >> Image processor Gemma3ImageProcessorFast {
18
  "crop_size": null,
19
  "data_format": "channels_first",
20
  "default_to_square": true,
 
52
  }
53
 
54
 
55
+ [INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file tokenizer.model from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.model
56
 
57
+ [INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.json
58
 
59
+ [INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file added_tokens.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/added_tokens.json
60
 
61
+ [INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/special_tokens_map.json
62
 
63
+ [INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer_config.json
64
 
65
+ [INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file chat_template.jinja from cache at None
66
 
67
+ [INFO|2025-10-27 03:13:25] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/processor_config.json
68
 
69
+ [INFO|2025-10-27 03:13:27] processing_utils.py:990 >> Processor Gemma3Processor:
70
  - image_processor: Gemma3ImageProcessorFast {
71
  "crop_size": null,
72
  "data_format": "channels_first",
 
7025
  }
7026
 
7027
 
7028
+ [INFO|2025-10-27 03:13:27] logging.py:143 >> Replace eos token: <end_of_turn>.
7029
 
7030
+ [INFO|2025-10-27 03:13:27] logging.py:143 >> Loading dataset treino_pt_rde3.json...
7031
 
7032
+ [INFO|2025-10-27 03:13:41] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/config.json
7033
 
7034
+ [INFO|2025-10-27 03:13:41] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
7035
 
7036
+ [INFO|2025-10-27 03:13:41] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
7037
+
7038
+ [INFO|2025-10-27 03:13:41] configuration_utils.py:770 >> Model config Gemma3Config {
7039
  "architectures": [
7040
  "Gemma3ForConditionalGeneration"
7041
  ],
 
7097
  }
7098
 
7099
 
7100
+ [INFO|2025-10-27 03:13:41] logging.py:143 >> Quantizing model to 4 bit with bitsandbytes.
7101
 
7102
+ [INFO|2025-10-27 03:13:41] logging.py:143 >> KV cache is disabled during training.
7103
 
7104
+ [INFO|2025-10-27 03:13:48] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
7105
 
7106
+ [INFO|2025-10-27 03:13:48] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
7107
 
7108
+ [INFO|2025-10-27 03:13:48] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
7109
 
7110
+ [INFO|2025-10-27 03:13:48] configuration_utils.py:770 >> Model config Gemma3Config {
7111
  "architectures": [
7112
  "Gemma3ForConditionalGeneration"
7113
  ],
 
7266
  }
7267
 
7268
 
7269
+ [INFO|2025-10-27 03:13:49] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
7270
 
7271
+ [INFO|2025-10-27 03:13:49] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
7272
 
7273
+ [INFO|2025-10-27 03:13:49] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
7274
 
7275
+ [INFO|2025-10-27 03:13:49] configuration_utils.py:770 >> Model config Gemma3Config {
7276
  "architectures": [
7277
  "Gemma3ForConditionalGeneration"
7278
  ],
 
7431
  }
7432
 
7433
 
7434
+ [INFO|2025-10-27 03:13:52] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
 
 
 
 
 
 
 
 
7435
 
7436
+ [INFO|2025-10-27 03:13:52] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
7437
 
7438
+ [INFO|2025-10-27 03:13:52] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
7439
 
7440
+ [INFO|2025-10-27 03:13:52] configuration_utils.py:770 >> Model config Gemma3Config {
7441
  "architectures": [
7442
  "Gemma3ForConditionalGeneration"
7443
  ],
 
7596
  }
7597
 
7598
 
7599
+ [INFO|2025-10-27 03:13:52] modeling_utils.py:1151 >> loading weights file model.safetensors from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/model.safetensors.index.json
7600
 
7601
+ [INFO|2025-10-27 03:14:56] modeling_utils.py:2241 >> Instantiating Gemma3ForConditionalGeneration model under default dtype torch.bfloat16.
7602
 
7603
+ [INFO|2025-10-27 03:14:56] configuration_utils.py:1135 >> Generate config GenerationConfig {
7604
  "bos_token_id": 2,
7605
  "eos_token_id": 106,
7606
  "pad_token_id": 0
7607
  }
7608
 
7609
 
7610
+ [INFO|2025-10-27 03:14:58] modeling_utils.py:2241 >> Instantiating SiglipVisionModel model under default dtype torch.bfloat16.
7611
 
7612
+ [INFO|2025-10-27 03:14:58] modeling_utils.py:2241 >> Instantiating Gemma3TextModel model under default dtype torch.bfloat16.
7613
 
7614
+ [INFO|2025-10-27 03:15:02] modeling_utils.py:5131 >> All model checkpoint weights were used when initializing Gemma3ForConditionalGeneration.
7615
 
7616
 
7617
+ [INFO|2025-10-27 03:15:02] modeling_utils.py:5139 >> All the weights of Gemma3ForConditionalGeneration were initialized from the model checkpoint at unsloth/gemma-3-12b-it-unsloth-bnb-4bit.
7618
  If your task is similar to the task the model of the checkpoint was trained on, you can already use Gemma3ForConditionalGeneration for predictions without further training.
7619
 
7620
+ [INFO|2025-10-27 03:15:03] configuration_utils.py:1090 >> loading configuration file generation_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/generation_config.json
7621
 
7622
+ [INFO|2025-10-27 03:15:03] configuration_utils.py:1135 >> Generate config GenerationConfig {
7623
  "bos_token_id": 2,
7624
  "cache_implementation": "hybrid",
7625
  "do_sample": true,
 
7633
  }
7634
 
7635
 
7636
+ [INFO|2025-10-27 03:15:05] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/processor_config.json
7637
 
7638
+ [INFO|2025-10-27 03:15:06] image_processing_base.py:380 >> loading configuration file preprocessor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/preprocessor_config.json
7639
 
7640
+ [INFO|2025-10-27 03:15:06] image_processing_base.py:433 >> Image processor Gemma3ImageProcessor {
7641
  "do_convert_rgb": null,
7642
  "do_normalize": true,
7643
  "do_pan_and_scan": null,
 
7668
  }
7669
 
7670
 
7671
+ [INFO|2025-10-27 03:15:11] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/processor_config.json
7672
 
7673
+ [INFO|2025-10-27 03:15:13] processing_utils.py:990 >> Processor Gemma3Processor:
7674
  - image_processor: Gemma3ImageProcessor {
7675
  "do_convert_rgb": null,
7676
  "do_normalize": true,
 
14622
  }
14623
 
14624
 
14625
+ [INFO|2025-10-27 03:15:16] logging.py:143 >> Gradient checkpointing enabled.
14626
 
14627
+ [INFO|2025-10-27 03:15:16] logging.py:143 >> Casting multimodal projector outputs in torch.bfloat16.
14628
 
14629
+ [INFO|2025-10-27 03:15:16] logging.py:143 >> Upcasting trainable params to float32.
14630
 
14631
+ [INFO|2025-10-27 03:15:16] logging.py:143 >> Fine-tuning method: LoRA
14632
 
14633
+ [INFO|2025-10-27 03:15:16] logging.py:143 >> Found linear modules: down_proj,gate_proj,up_proj,k_proj,v_proj,q_proj,o_proj
14634
 
14635
+ [INFO|2025-10-27 03:15:16] logging.py:143 >> Set vision model not trainable: ['vision_tower'].
14636
 
14637
+ [INFO|2025-10-27 03:15:16] logging.py:143 >> Set multi model projector not trainable: multi_modal_projector.
14638
 
14639
+ [INFO|2025-10-27 03:15:21] logging.py:143 >> trainable params: 32,735,232 || all params: 12,220,060,272 || trainable%: 0.2679
14640
 
14641
+ [INFO|2025-10-27 03:15:21] trainer.py:756 >> Using auto half precision backend
14642
 
14643
+ [INFO|2025-10-27 03:15:22] trainer.py:2409 >> ***** Running training *****
14644
 
14645
+ [INFO|2025-10-27 03:15:22] trainer.py:2410 >> Num examples = 3,716
14646
 
14647
+ [INFO|2025-10-27 03:15:22] trainer.py:2411 >> Num Epochs = 3
14648
 
14649
+ [INFO|2025-10-27 03:15:22] trainer.py:2412 >> Instantaneous batch size per device = 4
14650
 
14651
+ [INFO|2025-10-27 03:15:22] trainer.py:2415 >> Total train batch size (w. parallel, distributed & accumulation) = 8
14652
 
14653
+ [INFO|2025-10-27 03:15:22] trainer.py:2416 >> Gradient Accumulation steps = 2
14654
 
14655
+ [INFO|2025-10-27 03:15:22] trainer.py:2417 >> Total optimization steps = 1,395
14656
 
14657
+ [INFO|2025-10-27 03:15:22] trainer.py:2418 >> Number of trainable parameters = 32,735,232
14658
 
14659
+ [WARNING|2025-10-27 03:15:27] logging.py:328 >> `use_cache=True` is incompatible with gradient checkpointing. Setting `use_cache=False`.
14660
 
14661
+ [INFO|2025-10-27 03:16:26] logging.py:143 >> {'loss': 1.7834, 'learning_rate': 9.9990e-06, 'epoch': 0.02, 'throughput': 677.99}
14662
 
14663
+ [INFO|2025-10-27 03:16:57] logging.py:143 >> {'loss': 0.7676, 'learning_rate': 9.9954e-06, 'epoch': 0.04, 'throughput': 914.74}
14664
 
14665
+ [INFO|2025-10-27 03:17:28] logging.py:143 >> {'loss': 0.5817, 'learning_rate': 9.9893e-06, 'epoch': 0.06, 'throughput': 1039.71}
14666
 
14667
+ [INFO|2025-10-27 03:17:59] logging.py:143 >> {'loss': 0.3531, 'learning_rate': 9.9807e-06, 'epoch': 0.09, 'throughput': 1114.29}
14668
 
14669
+ [INFO|2025-10-27 03:18:30] logging.py:143 >> {'loss': 0.3352, 'learning_rate': 9.9696e-06, 'epoch': 0.11, 'throughput': 1163.66}
14670
 
14671
+ [INFO|2025-10-27 03:19:01] logging.py:143 >> {'loss': 0.2298, 'learning_rate': 9.9559e-06, 'epoch': 0.13, 'throughput': 1198.88}
14672
 
14673
+ [INFO|2025-10-27 03:19:32] logging.py:143 >> {'loss': 0.1981, 'learning_rate': 9.9398e-06, 'epoch': 0.15, 'throughput': 1224.72}
14674
 
14675
+ [INFO|2025-10-27 03:20:03] logging.py:143 >> {'loss': 0.1755, 'learning_rate': 9.9211e-06, 'epoch': 0.17, 'throughput': 1243.90}
14676
 
14677
+ [INFO|2025-10-27 03:20:34] logging.py:143 >> {'loss': 0.1791, 'learning_rate': 9.8999e-06, 'epoch': 0.19, 'throughput': 1260.94}
14678
 
14679
+ [INFO|2025-10-27 03:21:05] logging.py:143 >> {'loss': 0.2051, 'learning_rate': 9.8762e-06, 'epoch': 0.22, 'throughput': 1275.56}
14680
 
14681
+ [INFO|2025-10-27 03:21:36] logging.py:143 >> {'loss': 0.1912, 'learning_rate': 9.8501e-06, 'epoch': 0.24, 'throughput': 1286.52}
14682
 
14683
+ [INFO|2025-10-27 03:22:07] logging.py:143 >> {'loss': 0.1637, 'learning_rate': 9.8215e-06, 'epoch': 0.26, 'throughput': 1296.09}
14684
 
14685
+ [INFO|2025-10-27 03:22:38] logging.py:143 >> {'loss': 0.1537, 'learning_rate': 9.7905e-06, 'epoch': 0.28, 'throughput': 1305.22}
14686
 
14687
+ [INFO|2025-10-27 03:23:09] logging.py:143 >> {'loss': 0.1846, 'learning_rate': 9.7570e-06, 'epoch': 0.30, 'throughput': 1312.61}
14688
 
14689
+ [INFO|2025-10-27 03:23:40] logging.py:143 >> {'loss': 0.1872, 'learning_rate': 9.7211e-06, 'epoch': 0.32, 'throughput': 1319.26}
14690
 
14691
+ [INFO|2025-10-27 03:24:11] logging.py:143 >> {'loss': 0.1372, 'learning_rate': 9.6829e-06, 'epoch': 0.34, 'throughput': 1324.79}
14692
 
14693
+ [INFO|2025-10-27 03:24:42] logging.py:143 >> {'loss': 0.2028, 'learning_rate': 9.6422e-06, 'epoch': 0.37, 'throughput': 1329.47}
14694
 
14695
+ [INFO|2025-10-27 03:25:13] logging.py:143 >> {'loss': 0.1765, 'learning_rate': 9.5992e-06, 'epoch': 0.39, 'throughput': 1334.07}
14696
 
14697
+ [INFO|2025-10-27 03:25:44] logging.py:143 >> {'loss': 0.1882, 'learning_rate': 9.5539e-06, 'epoch': 0.41, 'throughput': 1337.87}
14698
 
14699
+ [INFO|2025-10-27 03:26:16] logging.py:143 >> {'loss': 0.1336, 'learning_rate': 9.5062e-06, 'epoch': 0.43, 'throughput': 1341.84}
14700
 
14701
+ [INFO|2025-10-27 03:26:47] logging.py:143 >> {'loss': 0.1521, 'learning_rate': 9.4563e-06, 'epoch': 0.45, 'throughput': 1345.07}
14702
 
14703
+ [INFO|2025-10-27 03:27:18] logging.py:143 >> {'loss': 0.1864, 'learning_rate': 9.4041e-06, 'epoch': 0.47, 'throughput': 1346.89}
14704
 
14705
+ [INFO|2025-10-27 03:27:49] logging.py:143 >> {'loss': 0.1625, 'learning_rate': 9.3497e-06, 'epoch': 0.50, 'throughput': 1349.36}
14706
 
14707
+ [INFO|2025-10-27 03:28:20] logging.py:143 >> {'loss': 0.1456, 'learning_rate': 9.2931e-06, 'epoch': 0.52, 'throughput': 1351.59}
14708
 
14709
+ [INFO|2025-10-27 03:28:51] logging.py:143 >> {'loss': 0.1650, 'learning_rate': 9.2343e-06, 'epoch': 0.54, 'throughput': 1354.07}
14710
 
14711
+ [INFO|2025-10-27 03:29:22] logging.py:143 >> {'loss': 0.1487, 'learning_rate': 9.1733e-06, 'epoch': 0.56, 'throughput': 1356.35}
14712
 
14713
+ [INFO|2025-10-27 03:29:53] logging.py:143 >> {'loss': 0.1687, 'learning_rate': 9.1102e-06, 'epoch': 0.58, 'throughput': 1358.32}
14714
 
14715
+ [INFO|2025-10-27 03:30:25] logging.py:143 >> {'loss': 0.1511, 'learning_rate': 9.0451e-06, 'epoch': 0.60, 'throughput': 1360.35}
14716
 
14717
+ [INFO|2025-10-27 03:30:56] logging.py:143 >> {'loss': 0.1840, 'learning_rate': 8.9779e-06, 'epoch': 0.62, 'throughput': 1361.79}
14718
 
14719
+ [INFO|2025-10-27 03:31:27] logging.py:143 >> {'loss': 0.1305, 'learning_rate': 8.9087e-06, 'epoch': 0.65, 'throughput': 1363.59}
14720
 
14721
+ [INFO|2025-10-27 03:31:58] logging.py:143 >> {'loss': 0.1405, 'learning_rate': 8.8375e-06, 'epoch': 0.67, 'throughput': 1365.17}
14722
 
14723
+ [INFO|2025-10-27 03:32:29] logging.py:143 >> {'loss': 0.1651, 'learning_rate': 8.7643e-06, 'epoch': 0.69, 'throughput': 1366.48}
14724
 
14725
+ [INFO|2025-10-27 03:33:00] logging.py:143 >> {'loss': 0.1519, 'learning_rate': 8.6892e-06, 'epoch': 0.71, 'throughput': 1367.92}
14726
 
14727
+ [INFO|2025-10-27 03:33:32] logging.py:143 >> {'loss': 0.1574, 'learning_rate': 8.6123e-06, 'epoch': 0.73, 'throughput': 1369.22}
14728
 
14729
+ [INFO|2025-10-27 03:34:03] logging.py:143 >> {'loss': 0.1587, 'learning_rate': 8.5335e-06, 'epoch': 0.75, 'throughput': 1370.83}
14730
 
14731
+ [INFO|2025-10-27 03:34:34] logging.py:143 >> {'loss': 0.1513, 'learning_rate': 8.4530e-06, 'epoch': 0.78, 'throughput': 1371.83}
14732
 
14733
+ [INFO|2025-10-27 03:35:06] logging.py:143 >> {'loss': 0.1401, 'learning_rate': 8.3707e-06, 'epoch': 0.80, 'throughput': 1372.77}
14734
 
14735
+ [INFO|2025-10-27 03:35:37] logging.py:143 >> {'loss': 0.1135, 'learning_rate': 8.2867e-06, 'epoch': 0.82, 'throughput': 1373.73}
14736
 
14737
+ [INFO|2025-10-27 03:36:08] logging.py:143 >> {'loss': 0.1645, 'learning_rate': 8.2010e-06, 'epoch': 0.84, 'throughput': 1374.92}
14738
 
14739
+ [INFO|2025-10-27 03:36:39] logging.py:143 >> {'loss': 0.1129, 'learning_rate': 8.1137e-06, 'epoch': 0.86, 'throughput': 1375.83}
14740
 
14741
+ [INFO|2025-10-27 03:37:10] logging.py:143 >> {'loss': 0.1333, 'learning_rate': 8.0248e-06, 'epoch': 0.88, 'throughput': 1376.82}
14742
 
14743
+ [INFO|2025-10-27 03:37:41] logging.py:143 >> {'loss': 0.1311, 'learning_rate': 7.9344e-06, 'epoch': 0.90, 'throughput': 1377.63}
14744
 
14745
+ [INFO|2025-10-27 03:38:12] logging.py:143 >> {'loss': 0.1395, 'learning_rate': 7.8425e-06, 'epoch': 0.93, 'throughput': 1378.55}
14746
 
14747
+ [INFO|2025-10-27 03:38:43] logging.py:143 >> {'loss': 0.1175, 'learning_rate': 7.7491e-06, 'epoch': 0.95, 'throughput': 1379.32}
14748
 
14749
+ [INFO|2025-10-27 03:39:14] logging.py:143 >> {'loss': 0.1154, 'learning_rate': 7.6544e-06, 'epoch': 0.97, 'throughput': 1379.96}
14750
 
14751
+ [INFO|2025-10-27 03:39:45] logging.py:143 >> {'loss': 0.1408, 'learning_rate': 7.5583e-06, 'epoch': 0.99, 'throughput': 1380.68}
14752
 
14753
+ [INFO|2025-10-27 03:40:14] logging.py:143 >> {'loss': 0.1126, 'learning_rate': 7.4609e-06, 'epoch': 1.01, 'throughput': 1381.29}
14754
 
14755
+ [INFO|2025-10-27 03:40:45] logging.py:143 >> {'loss': 0.1329, 'learning_rate': 7.3623e-06, 'epoch': 1.03, 'throughput': 1382.02}
14756
 
14757
+ [INFO|2025-10-27 03:41:17] logging.py:143 >> {'loss': 0.1110, 'learning_rate': 7.2624e-06, 'epoch': 1.05, 'throughput': 1382.64}
14758
 
14759
+ [INFO|2025-10-27 03:41:48] logging.py:143 >> {'loss': 0.1130, 'learning_rate': 7.1614e-06, 'epoch': 1.08, 'throughput': 1383.36}
14760
 
14761
+ [INFO|2025-10-27 03:42:19] logging.py:143 >> {'loss': 0.1303, 'learning_rate': 7.0594e-06, 'epoch': 1.10, 'throughput': 1384.03}
14762
 
14763
+ [INFO|2025-10-27 03:42:50] logging.py:143 >> {'loss': 0.1404, 'learning_rate': 6.9562e-06, 'epoch': 1.12, 'throughput': 1384.60}
14764
 
14765
+ [INFO|2025-10-27 03:43:21] logging.py:143 >> {'loss': 0.0972, 'learning_rate': 6.8521e-06, 'epoch': 1.14, 'throughput': 1385.09}
14766
 
14767
+ [INFO|2025-10-27 03:43:52] logging.py:143 >> {'loss': 0.1092, 'learning_rate': 6.7471e-06, 'epoch': 1.16, 'throughput': 1385.58}
14768
 
14769
+ [INFO|2025-10-27 03:44:23] logging.py:143 >> {'loss': 0.1186, 'learning_rate': 6.6411e-06, 'epoch': 1.18, 'throughput': 1386.00}
14770
 
14771
+ [INFO|2025-10-27 03:44:54] logging.py:143 >> {'loss': 0.1332, 'learning_rate': 6.5344e-06, 'epoch': 1.20, 'throughput': 1386.55}
14772
 
14773
+ [INFO|2025-10-27 03:45:25] logging.py:143 >> {'loss': 0.1481, 'learning_rate': 6.4268e-06, 'epoch': 1.23, 'throughput': 1386.93}
14774
 
14775
+ [INFO|2025-10-27 03:45:56] logging.py:143 >> {'loss': 0.1332, 'learning_rate': 6.3186e-06, 'epoch': 1.25, 'throughput': 1387.57}
14776
 
14777
+ [INFO|2025-10-27 03:46:27] logging.py:143 >> {'loss': 0.0978, 'learning_rate': 6.2096e-06, 'epoch': 1.27, 'throughput': 1387.91}
14778
 
14779
+ [INFO|2025-10-27 03:46:58] logging.py:143 >> {'loss': 0.1176, 'learning_rate': 6.1001e-06, 'epoch': 1.29, 'throughput': 1388.30}
14780
 
14781
+ [INFO|2025-10-27 03:47:29] logging.py:143 >> {'loss': 0.1279, 'learning_rate': 5.9899e-06, 'epoch': 1.31, 'throughput': 1388.66}
14782
 
14783
+ [INFO|2025-10-27 03:48:00] logging.py:143 >> {'loss': 0.1407, 'learning_rate': 5.8793e-06, 'epoch': 1.33, 'throughput': 1388.98}
14784
 
14785
+ [INFO|2025-10-27 03:48:31] logging.py:143 >> {'loss': 0.1168, 'learning_rate': 5.7683e-06, 'epoch': 1.36, 'throughput': 1389.35}
14786
 
14787
+ [INFO|2025-10-27 03:49:03] logging.py:143 >> {'loss': 0.1188, 'learning_rate': 5.6568e-06, 'epoch': 1.38, 'throughput': 1389.81}
14788
 
14789
+ [INFO|2025-10-27 03:49:33] logging.py:143 >> {'loss': 0.1326, 'learning_rate': 5.5450e-06, 'epoch': 1.40, 'throughput': 1390.15}
14790
 
14791
+ [INFO|2025-10-27 03:50:04] logging.py:143 >> {'loss': 0.1331, 'learning_rate': 5.4330e-06, 'epoch': 1.42, 'throughput': 1390.61}
14792
 
14793
+ [INFO|2025-10-27 03:50:35] logging.py:143 >> {'loss': 0.1082, 'learning_rate': 5.3207e-06, 'epoch': 1.44, 'throughput': 1390.83}
14794
 
14795
+ [INFO|2025-10-27 03:51:06] logging.py:143 >> {'loss': 0.1184, 'learning_rate': 5.2083e-06, 'epoch': 1.46, 'throughput': 1391.28}
14796
 
14797
+ [INFO|2025-10-27 03:51:38] logging.py:143 >> {'loss': 0.0942, 'learning_rate': 5.0957e-06, 'epoch': 1.48, 'throughput': 1391.62}
14798
 
14799
+ [INFO|2025-10-27 03:52:08] logging.py:143 >> {'loss': 0.1204, 'learning_rate': 4.9831e-06, 'epoch': 1.51, 'throughput': 1391.78}
14800
 
14801
+ [INFO|2025-10-27 03:52:39] logging.py:143 >> {'loss': 0.1358, 'learning_rate': 4.8705e-06, 'epoch': 1.53, 'throughput': 1391.95}
14802
 
14803
+ [INFO|2025-10-27 03:53:10] logging.py:143 >> {'loss': 0.1313, 'learning_rate': 4.7580e-06, 'epoch': 1.55, 'throughput': 1392.21}
14804
 
14805
+ [INFO|2025-10-27 03:53:41] logging.py:143 >> {'loss': 0.0879, 'learning_rate': 4.6456e-06, 'epoch': 1.57, 'throughput': 1392.44}
14806
 
14807
+ [INFO|2025-10-27 03:54:12] logging.py:143 >> {'loss': 0.0977, 'learning_rate': 4.5334e-06, 'epoch': 1.59, 'throughput': 1392.74}
14808
 
14809
+ [INFO|2025-10-27 03:54:44] logging.py:143 >> {'loss': 0.1483, 'learning_rate': 4.4214e-06, 'epoch': 1.61, 'throughput': 1393.03}
14810
 
14811
+ [INFO|2025-10-27 03:55:14] logging.py:143 >> {'loss': 0.1285, 'learning_rate': 4.3097e-06, 'epoch': 1.64, 'throughput': 1393.12}
14812
 
14813
+ [INFO|2025-10-27 03:55:46] logging.py:143 >> {'loss': 0.1475, 'learning_rate': 4.1984e-06, 'epoch': 1.66, 'throughput': 1393.46}
14814
 
14815
+ [INFO|2025-10-27 03:56:17] logging.py:143 >> {'loss': 0.0904, 'learning_rate': 4.0874e-06, 'epoch': 1.68, 'throughput': 1393.73}
14816
 
14817
+ [INFO|2025-10-27 03:56:48] logging.py:143 >> {'loss': 0.1199, 'learning_rate': 3.9770e-06, 'epoch': 1.70, 'throughput': 1393.93}
14818
 
14819
+ [INFO|2025-10-27 03:57:19] logging.py:143 >> {'loss': 0.1020, 'learning_rate': 3.8670e-06, 'epoch': 1.72, 'throughput': 1394.19}
14820
 
14821
+ [INFO|2025-10-27 03:57:51] logging.py:143 >> {'loss': 0.1194, 'learning_rate': 3.7576e-06, 'epoch': 1.74, 'throughput': 1394.24}
14822
 
14823
+ [INFO|2025-10-27 03:58:23] logging.py:143 >> {'loss': 0.1507, 'learning_rate': 3.6489e-06, 'epoch': 1.76, 'throughput': 1394.60}
14824
 
14825
+ [INFO|2025-10-27 03:58:54] logging.py:143 >> {'loss': 0.1015, 'learning_rate': 3.5408e-06, 'epoch': 1.79, 'throughput': 1394.81}
14826
 
14827
+ [INFO|2025-10-27 03:59:25] logging.py:143 >> {'loss': 0.1165, 'learning_rate': 3.4335e-06, 'epoch': 1.81, 'throughput': 1395.10}
14828
 
14829
+ [INFO|2025-10-27 03:59:56] logging.py:143 >> {'loss': 0.0958, 'learning_rate': 3.3270e-06, 'epoch': 1.83, 'throughput': 1395.22}
14830
 
14831
+ [INFO|2025-10-27 04:00:28] logging.py:143 >> {'loss': 0.1505, 'learning_rate': 3.2213e-06, 'epoch': 1.85, 'throughput': 1395.41}
14832
 
14833
+ [INFO|2025-10-27 04:00:59] logging.py:143 >> {'loss': 0.1003, 'learning_rate': 3.1165e-06, 'epoch': 1.87, 'throughput': 1395.71}
14834
 
14835
+ [INFO|2025-10-27 04:01:30] logging.py:143 >> {'loss': 0.1483, 'learning_rate': 3.0127e-06, 'epoch': 1.89, 'throughput': 1395.87}
14836
 
14837
+ [INFO|2025-10-27 04:02:01] logging.py:143 >> {'loss': 0.1170, 'learning_rate': 2.9099e-06, 'epoch': 1.91, 'throughput': 1396.08}
14838
 
14839
+ [INFO|2025-10-27 04:02:33] logging.py:143 >> {'loss': 0.1303, 'learning_rate': 2.8081e-06, 'epoch': 1.94, 'throughput': 1396.22}
14840
 
14841
+ [INFO|2025-10-27 04:03:04] logging.py:143 >> {'loss': 0.0971, 'learning_rate': 2.7075e-06, 'epoch': 1.96, 'throughput': 1396.34}
14842
 
14843
+ [INFO|2025-10-27 04:03:35] logging.py:143 >> {'loss': 0.1320, 'learning_rate': 2.6080e-06, 'epoch': 1.98, 'throughput': 1396.59}
14844
 
14845
+ [INFO|2025-10-27 04:04:05] logging.py:143 >> {'loss': 0.0930, 'learning_rate': 2.5098e-06, 'epoch': 2.00, 'throughput': 1396.82}
14846
 
14847
+ [INFO|2025-10-27 04:04:36] logging.py:143 >> {'loss': 0.1324, 'learning_rate': 2.4128e-06, 'epoch': 2.02, 'throughput': 1396.98}
14848
 
14849
+ [INFO|2025-10-27 04:05:07] logging.py:143 >> {'loss': 0.0841, 'learning_rate': 2.3171e-06, 'epoch': 2.04, 'throughput': 1397.11}
14850
 
14851
+ [INFO|2025-10-27 04:05:38] logging.py:143 >> {'loss': 0.1138, 'learning_rate': 2.2227e-06, 'epoch': 2.06, 'throughput': 1397.24}
14852
 
14853
+ [INFO|2025-10-27 04:06:09] logging.py:143 >> {'loss': 0.0892, 'learning_rate': 2.1298e-06, 'epoch': 2.09, 'throughput': 1397.46}
14854
 
14855
+ [INFO|2025-10-27 04:06:40] logging.py:143 >> {'loss': 0.1277, 'learning_rate': 2.0383e-06, 'epoch': 2.11, 'throughput': 1397.61}
14856
 
14857
+ [INFO|2025-10-27 04:07:11] logging.py:143 >> {'loss': 0.0968, 'learning_rate': 1.9484e-06, 'epoch': 2.13, 'throughput': 1397.71}
14858
 
14859
+ [INFO|2025-10-27 04:07:42] logging.py:143 >> {'loss': 0.1226, 'learning_rate': 1.8600e-06, 'epoch': 2.15, 'throughput': 1397.94}
14860
 
14861
+ [INFO|2025-10-27 04:07:42] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000
14862
 
14863
+ [INFO|2025-10-27 04:07:44] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/preprocessor_config.json
14864
 
14865
+ [INFO|2025-10-27 04:07:47] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/chat_template.jinja
14866
 
14867
+ [INFO|2025-10-27 04:07:49] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/processor_config.json
14868
 
14869
+ [INFO|2025-10-27 04:08:20] logging.py:143 >> {'loss': 0.1201, 'learning_rate': 1.7731e-06, 'epoch': 2.17, 'throughput': 1395.31}
14870
 
14871
+ [INFO|2025-10-27 04:08:51] logging.py:143 >> {'loss': 0.0966, 'learning_rate': 1.6880e-06, 'epoch': 2.19, 'throughput': 1395.47}
14872
 
14873
+ [INFO|2025-10-27 04:09:23] logging.py:143 >> {'loss': 0.1143, 'learning_rate': 1.6044e-06, 'epoch': 2.22, 'throughput': 1395.66}
14874
 
14875
+ [INFO|2025-10-27 04:09:54] logging.py:143 >> {'loss': 0.1114, 'learning_rate': 1.5227e-06, 'epoch': 2.24, 'throughput': 1395.80}
14876
 
14877
+ [INFO|2025-10-27 04:10:25] logging.py:143 >> {'loss': 0.0981, 'learning_rate': 1.4426e-06, 'epoch': 2.26, 'throughput': 1395.88}
14878
 
14879
+ [INFO|2025-10-27 04:10:56] logging.py:143 >> {'loss': 0.1135, 'learning_rate': 1.3644e-06, 'epoch': 2.28, 'throughput': 1396.01}
14880
 
14881
+ [INFO|2025-10-27 04:11:27] logging.py:143 >> {'loss': 0.1081, 'learning_rate': 1.2880e-06, 'epoch': 2.30, 'throughput': 1396.08}
14882
 
14883
+ [INFO|2025-10-27 04:11:58] logging.py:143 >> {'loss': 0.0685, 'learning_rate': 1.2136e-06, 'epoch': 2.32, 'throughput': 1396.28}
14884
 
14885
+ [INFO|2025-10-27 04:12:30] logging.py:143 >> {'loss': 0.0857, 'learning_rate': 1.1410e-06, 'epoch': 2.34, 'throughput': 1396.47}
14886
 
14887
+ [INFO|2025-10-27 04:13:00] logging.py:143 >> {'loss': 0.1008, 'learning_rate': 1.0704e-06, 'epoch': 2.37, 'throughput': 1396.60}
14888
 
14889
+ [INFO|2025-10-27 04:13:32] logging.py:143 >> {'loss': 0.1137, 'learning_rate': 1.0017e-06, 'epoch': 2.39, 'throughput': 1396.71}
14890
 
14891
+ [INFO|2025-10-27 04:14:03] logging.py:143 >> {'loss': 0.1038, 'learning_rate': 9.3515e-07, 'epoch': 2.41, 'throughput': 1396.77}
14892
 
14893
+ [INFO|2025-10-27 04:14:34] logging.py:143 >> {'loss': 0.1194, 'learning_rate': 8.7062e-07, 'epoch': 2.43, 'throughput': 1396.84}
14894
 
14895
+ [INFO|2025-10-27 04:15:05] logging.py:143 >> {'loss': 0.1161, 'learning_rate': 8.0818e-07, 'epoch': 2.45, 'throughput': 1396.93}
14896
 
14897
+ [INFO|2025-10-27 04:15:36] logging.py:143 >> {'loss': 0.1000, 'learning_rate': 7.4787e-07, 'epoch': 2.47, 'throughput': 1397.05}
14898
 
14899
+ [INFO|2025-10-27 04:16:07] logging.py:143 >> {'loss': 0.0996, 'learning_rate': 6.8971e-07, 'epoch': 2.50, 'throughput': 1397.15}
14900
 
14901
+ [INFO|2025-10-27 04:16:38] logging.py:143 >> {'loss': 0.0944, 'learning_rate': 6.3374e-07, 'epoch': 2.52, 'throughput': 1397.31}
14902
 
14903
+ [INFO|2025-10-27 04:17:09] logging.py:143 >> {'loss': 0.0800, 'learning_rate': 5.7999e-07, 'epoch': 2.54, 'throughput': 1397.41}
14904
 
14905
+ [INFO|2025-10-27 04:17:41] logging.py:143 >> {'loss': 0.0962, 'learning_rate': 5.2847e-07, 'epoch': 2.56, 'throughput': 1397.57}
14906
 
14907
+ [INFO|2025-10-27 04:18:12] logging.py:143 >> {'loss': 0.0940, 'learning_rate': 4.7923e-07, 'epoch': 2.58, 'throughput': 1397.63}
14908
 
14909
+ [INFO|2025-10-27 04:18:43] logging.py:143 >> {'loss': 0.1005, 'learning_rate': 4.3227e-07, 'epoch': 2.60, 'throughput': 1397.77}
14910
 
14911
+ [INFO|2025-10-27 04:19:14] logging.py:143 >> {'loss': 0.1167, 'learning_rate': 3.8764e-07, 'epoch': 2.62, 'throughput': 1397.85}
14912
 
14913
+ [INFO|2025-10-27 04:19:45] logging.py:143 >> {'loss': 0.0907, 'learning_rate': 3.4534e-07, 'epoch': 2.65, 'throughput': 1397.99}
14914
 
14915
+ [INFO|2025-10-27 04:20:16] logging.py:143 >> {'loss': 0.1074, 'learning_rate': 3.0540e-07, 'epoch': 2.67, 'throughput': 1398.14}
14916
 
14917
+ [INFO|2025-10-27 04:20:47] logging.py:143 >> {'loss': 0.1128, 'learning_rate': 2.6784e-07, 'epoch': 2.69, 'throughput': 1398.24}
14918
 
14919
+ [INFO|2025-10-27 04:21:18] logging.py:143 >> {'loss': 0.1016, 'learning_rate': 2.3269e-07, 'epoch': 2.71, 'throughput': 1398.36}
14920
 
14921
+ [INFO|2025-10-27 04:21:49] logging.py:143 >> {'loss': 0.1052, 'learning_rate': 1.9995e-07, 'epoch': 2.73, 'throughput': 1398.46}
14922
 
14923
+ [INFO|2025-10-27 04:22:20] logging.py:143 >> {'loss': 0.0918, 'learning_rate': 1.6964e-07, 'epoch': 2.75, 'throughput': 1398.56}
14924
 
14925
+ [INFO|2025-10-27 04:22:50] logging.py:143 >> {'loss': 0.1090, 'learning_rate': 1.4179e-07, 'epoch': 2.78, 'throughput': 1398.61}
14926
 
14927
+ [INFO|2025-10-27 04:23:22] logging.py:143 >> {'loss': 0.1224, 'learning_rate': 1.1640e-07, 'epoch': 2.80, 'throughput': 1398.72}
14928
 
14929
+ [INFO|2025-10-27 04:23:53] logging.py:143 >> {'loss': 0.0992, 'learning_rate': 9.3482e-08, 'epoch': 2.82, 'throughput': 1398.83}
14930
 
14931
+ [INFO|2025-10-27 04:24:24] logging.py:143 >> {'loss': 0.1070, 'learning_rate': 7.3056e-08, 'epoch': 2.84, 'throughput': 1398.91}
14932
 
14933
+ [INFO|2025-10-27 04:24:55] logging.py:143 >> {'loss': 0.0944, 'learning_rate': 5.5129e-08, 'epoch': 2.86, 'throughput': 1398.97}
14934
 
14935
+ [INFO|2025-10-27 04:25:26] logging.py:143 >> {'loss': 0.0867, 'learning_rate': 3.9709e-08, 'epoch': 2.88, 'throughput': 1399.03}
14936
 
14937
+ [INFO|2025-10-27 04:25:57] logging.py:143 >> {'loss': 0.1075, 'learning_rate': 2.6805e-08, 'epoch': 2.90, 'throughput': 1399.15}
14938
 
14939
+ [INFO|2025-10-27 04:26:28] logging.py:143 >> {'loss': 0.1042, 'learning_rate': 1.6423e-08, 'epoch': 2.93, 'throughput': 1399.23}
14940
 
14941
+ [INFO|2025-10-27 04:26:59] logging.py:143 >> {'loss': 0.0964, 'learning_rate': 8.5687e-09, 'epoch': 2.95, 'throughput': 1399.25}
14942
 
14943
+ [INFO|2025-10-27 04:27:30] logging.py:143 >> {'loss': 0.0922, 'learning_rate': 3.2455e-09, 'epoch': 2.97, 'throughput': 1399.11}
14944
 
14945
+ [INFO|2025-10-27 04:28:01] logging.py:143 >> {'loss': 0.1150, 'learning_rate': 4.5644e-10, 'epoch': 2.99, 'throughput': 1399.22}
14946
 
14947
+ [INFO|2025-10-27 04:28:15] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395
14948
 
14949
+ [INFO|2025-10-27 04:28:17] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/preprocessor_config.json
14950
 
14951
+ [INFO|2025-10-27 04:28:20] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/chat_template.jinja
14952
 
14953
+ [INFO|2025-10-27 04:28:22] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/processor_config.json
14954
 
14955
+ [INFO|2025-10-27 04:28:22] trainer.py:2676 >>
14956
 
14957
  Training completed. Do not forget to share your model on huggingface.co/models =)
14958
 
14959
 
14960
 
14961
+ [INFO|2025-10-27 04:28:22] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/preprocessor_config.json
14962
 
14963
+ [INFO|2025-10-27 04:28:24] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/chat_template.jinja
14964
 
14965
+ [INFO|2025-10-27 04:28:26] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/processor_config.json
14966
 
14967
+ [INFO|2025-10-27 04:28:26] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado
14968
 
14969
+ [WARNING|2025-10-27 04:28:27] logging.py:148 >> No metric eval_loss to plot.
14970
 
14971
+ [WARNING|2025-10-27 04:28:27] logging.py:148 >> No metric eval_accuracy to plot.
14972
 
14973
+ [INFO|2025-10-27 04:28:27] modelcard.py:450 >> Dropping the following result as it does not have all the necessary fields:
14974
  {'task': {'name': 'Causal Language Modeling', 'type': 'text-generation'}}
14975
 
special_tokens_map.json CHANGED
@@ -9,7 +9,7 @@
9
  },
10
  "eoi_token": "<end_of_image>",
11
  "eos_token": {
12
- "content": "<eos>",
13
  "lstrip": false,
14
  "normalized": false,
15
  "rstrip": false,
 
9
  },
10
  "eoi_token": "<end_of_image>",
11
  "eos_token": {
12
+ "content": "<end_of_turn>",
13
  "lstrip": false,
14
  "normalized": false,
15
  "rstrip": false,
tokenizer_config.json CHANGED
@@ -51327,7 +51327,7 @@
51327
  "bos_token": "<bos>",
51328
  "clean_up_tokenization_spaces": false,
51329
  "eoi_token": "<end_of_image>",
51330
- "eos_token": "<eos>",
51331
  "extra_special_tokens": {
51332
  "boi_token": "<start_of_image>",
51333
  "eoi_token": "<end_of_image>",
 
51327
  "bos_token": "<bos>",
51328
  "clean_up_tokenization_spaces": false,
51329
  "eoi_token": "<end_of_image>",
51330
+ "eos_token": "<end_of_turn>",
51331
  "extra_special_tokens": {
51332
  "boi_token": "<start_of_image>",
51333
  "eoi_token": "<end_of_image>",
train_results.json CHANGED
@@ -1,9 +1,9 @@
1
  {
2
  "epoch": 3.0,
3
- "num_input_tokens_seen": 3722368,
4
- "total_flos": 2.5033214310893568e+17,
5
- "train_loss": 0.0,
6
- "train_runtime": 3072.4201,
7
- "train_samples_per_second": 3.628,
8
- "train_steps_per_second": 0.454
9
  }
 
1
  {
2
  "epoch": 3.0,
3
+ "num_input_tokens_seen": 6120032,
4
+ "total_flos": 4.115769119160883e+17,
5
+ "train_loss": 0.1491297289889346,
6
+ "train_runtime": 4379.932,
7
+ "train_samples_per_second": 2.545,
8
+ "train_steps_per_second": 0.318
9
  }
trainer_log.jsonl CHANGED
@@ -1,140 +1,140 @@
1
- {"current_steps": 10, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.021528525296017224, "percentage": 0.72, "elapsed_time": "0:01:12", "remaining_time": "2:46:25", "throughput": 368.39, "total_tokens": 26560}
2
- {"current_steps": 20, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.04305705059203445, "percentage": 1.43, "elapsed_time": "0:01:33", "remaining_time": "1:47:06", "throughput": 563.5, "total_tokens": 52672}
3
- {"current_steps": 30, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.06458557588805167, "percentage": 2.15, "elapsed_time": "0:01:55", "remaining_time": "1:27:16", "throughput": 689.52, "total_tokens": 79360}
4
- {"current_steps": 40, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.0861141011840689, "percentage": 2.87, "elapsed_time": "0:02:16", "remaining_time": "1:17:19", "throughput": 777.03, "total_tokens": 106432}
5
- {"current_steps": 50, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.10764262648008611, "percentage": 3.58, "elapsed_time": "0:02:38", "remaining_time": "1:11:01", "throughput": 839.4, "total_tokens": 132992}
6
- {"current_steps": 60, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.12917115177610333, "percentage": 4.3, "elapsed_time": "0:03:00", "remaining_time": "1:06:48", "throughput": 887.84, "total_tokens": 159936}
7
- {"current_steps": 70, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.15069967707212056, "percentage": 5.02, "elapsed_time": "0:03:21", "remaining_time": "1:03:36", "throughput": 925.7, "total_tokens": 186624}
8
- {"current_steps": 80, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.1722282023681378, "percentage": 5.73, "elapsed_time": "0:03:43", "remaining_time": "1:01:09", "throughput": 955.09, "total_tokens": 213216}
9
- {"current_steps": 90, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.193756727664155, "percentage": 6.45, "elapsed_time": "0:04:04", "remaining_time": "0:59:10", "throughput": 977.51, "total_tokens": 239328}
10
- {"current_steps": 100, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.21528525296017223, "percentage": 7.17, "elapsed_time": "0:04:26", "remaining_time": "0:57:29", "throughput": 998.32, "total_tokens": 265920}
11
- {"current_steps": 110, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.23681377825618946, "percentage": 7.89, "elapsed_time": "0:04:47", "remaining_time": "0:56:03", "throughput": 1015.26, "total_tokens": 292288}
12
- {"current_steps": 120, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.25834230355220666, "percentage": 8.6, "elapsed_time": "0:05:09", "remaining_time": "0:54:51", "throughput": 1030.71, "total_tokens": 319264}
13
- {"current_steps": 130, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.2798708288482239, "percentage": 9.32, "elapsed_time": "0:05:31", "remaining_time": "0:53:45", "throughput": 1044.39, "total_tokens": 346144}
14
- {"current_steps": 140, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.3013993541442411, "percentage": 10.04, "elapsed_time": "0:05:52", "remaining_time": "0:52:44", "throughput": 1056.1, "total_tokens": 372800}
15
- {"current_steps": 150, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.32292787944025836, "percentage": 10.75, "elapsed_time": "0:06:14", "remaining_time": "0:51:49", "throughput": 1066.57, "total_tokens": 399552}
16
- {"current_steps": 160, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.3444564047362756, "percentage": 11.47, "elapsed_time": "0:06:36", "remaining_time": "0:50:58", "throughput": 1076.21, "total_tokens": 426464}
17
- {"current_steps": 170, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.36598493003229277, "percentage": 12.19, "elapsed_time": "0:06:57", "remaining_time": "0:50:09", "throughput": 1083.81, "total_tokens": 452672}
18
- {"current_steps": 180, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.38751345532831, "percentage": 12.9, "elapsed_time": "0:07:19", "remaining_time": "0:49:24", "throughput": 1090.87, "total_tokens": 479136}
19
- {"current_steps": 190, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.40904198062432723, "percentage": 13.62, "elapsed_time": "0:07:40", "remaining_time": "0:48:42", "throughput": 1097.53, "total_tokens": 505728}
20
- {"current_steps": 200, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.43057050592034446, "percentage": 14.34, "elapsed_time": "0:08:02", "remaining_time": "0:48:02", "throughput": 1104.11, "total_tokens": 532576}
21
- {"current_steps": 210, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.4520990312163617, "percentage": 15.05, "elapsed_time": "0:08:23", "remaining_time": "0:47:23", "throughput": 1109.59, "total_tokens": 559168}
22
- {"current_steps": 220, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.4736275565123789, "percentage": 15.77, "elapsed_time": "0:08:45", "remaining_time": "0:46:47", "throughput": 1115.15, "total_tokens": 586144}
23
- {"current_steps": 230, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.4951560818083961, "percentage": 16.49, "elapsed_time": "0:09:07", "remaining_time": "0:46:10", "throughput": 1119.52, "total_tokens": 612416}
24
- {"current_steps": 240, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.5166846071044133, "percentage": 17.2, "elapsed_time": "0:09:28", "remaining_time": "0:45:37", "throughput": 1124.5, "total_tokens": 639584}
25
- {"current_steps": 250, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.5382131324004306, "percentage": 17.92, "elapsed_time": "0:09:50", "remaining_time": "0:45:02", "throughput": 1128.64, "total_tokens": 665952}
26
- {"current_steps": 260, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.5597416576964478, "percentage": 18.64, "elapsed_time": "0:10:11", "remaining_time": "0:44:31", "throughput": 1133.22, "total_tokens": 693440}
27
- {"current_steps": 270, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.581270182992465, "percentage": 19.35, "elapsed_time": "0:10:33", "remaining_time": "0:43:59", "throughput": 1136.75, "total_tokens": 720128}
28
- {"current_steps": 280, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.6027987082884823, "percentage": 20.07, "elapsed_time": "0:10:55", "remaining_time": "0:43:29", "throughput": 1140.53, "total_tokens": 747360}
29
- {"current_steps": 290, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.6243272335844995, "percentage": 20.79, "elapsed_time": "0:11:16", "remaining_time": "0:42:59", "throughput": 1144.51, "total_tokens": 774752}
30
- {"current_steps": 300, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.6458557588805167, "percentage": 21.51, "elapsed_time": "0:11:38", "remaining_time": "0:42:28", "throughput": 1147.37, "total_tokens": 801216}
31
- {"current_steps": 310, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.667384284176534, "percentage": 22.22, "elapsed_time": "0:11:59", "remaining_time": "0:41:58", "throughput": 1149.86, "total_tokens": 827552}
32
- {"current_steps": 320, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.6889128094725512, "percentage": 22.94, "elapsed_time": "0:12:21", "remaining_time": "0:41:30", "throughput": 1152.43, "total_tokens": 854304}
33
- {"current_steps": 330, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.7104413347685683, "percentage": 23.66, "elapsed_time": "0:12:42", "remaining_time": "0:41:02", "throughput": 1155.17, "total_tokens": 881344}
34
- {"current_steps": 340, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.7319698600645855, "percentage": 24.37, "elapsed_time": "0:13:04", "remaining_time": "0:40:33", "throughput": 1157.39, "total_tokens": 907872}
35
- {"current_steps": 350, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.7534983853606028, "percentage": 25.09, "elapsed_time": "0:13:26", "remaining_time": "0:40:09", "throughput": 1160.01, "total_tokens": 935968}
36
- {"current_steps": 360, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.77502691065662, "percentage": 25.81, "elapsed_time": "0:13:48", "remaining_time": "0:39:41", "throughput": 1162.16, "total_tokens": 962816}
37
- {"current_steps": 370, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.7965554359526372, "percentage": 26.52, "elapsed_time": "0:14:10", "remaining_time": "0:39:16", "throughput": 1164.84, "total_tokens": 990848}
38
- {"current_steps": 380, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.8180839612486545, "percentage": 27.24, "elapsed_time": "0:14:32", "remaining_time": "0:38:49", "throughput": 1166.79, "total_tokens": 1017632}
39
- {"current_steps": 390, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.8396124865446717, "percentage": 27.96, "elapsed_time": "0:14:53", "remaining_time": "0:38:22", "throughput": 1168.33, "total_tokens": 1044000}
40
- {"current_steps": 400, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.8611410118406889, "percentage": 28.67, "elapsed_time": "0:15:14", "remaining_time": "0:37:55", "throughput": 1169.74, "total_tokens": 1070240}
41
- {"current_steps": 410, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.8826695371367062, "percentage": 29.39, "elapsed_time": "0:15:36", "remaining_time": "0:37:30", "throughput": 1171.36, "total_tokens": 1097056}
42
- {"current_steps": 420, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.9041980624327234, "percentage": 30.11, "elapsed_time": "0:15:58", "remaining_time": "0:37:04", "throughput": 1172.82, "total_tokens": 1123744}
43
- {"current_steps": 430, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.9257265877287406, "percentage": 30.82, "elapsed_time": "0:16:19", "remaining_time": "0:36:38", "throughput": 1174.11, "total_tokens": 1150432}
44
- {"current_steps": 440, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.9472551130247578, "percentage": 31.54, "elapsed_time": "0:16:40", "remaining_time": "0:36:12", "throughput": 1174.69, "total_tokens": 1175840}
45
- {"current_steps": 450, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.9687836383207751, "percentage": 32.26, "elapsed_time": "0:17:02", "remaining_time": "0:35:47", "throughput": 1176.13, "total_tokens": 1202496}
46
- {"current_steps": 460, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 0.9903121636167922, "percentage": 32.97, "elapsed_time": "0:17:23", "remaining_time": "0:35:21", "throughput": 1177.23, "total_tokens": 1228896}
47
- {"current_steps": 470, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.0107642626480087, "percentage": 33.69, "elapsed_time": "0:17:44", "remaining_time": "0:34:55", "throughput": 1178.47, "total_tokens": 1254560}
48
- {"current_steps": 480, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.0322927879440258, "percentage": 34.41, "elapsed_time": "0:18:05", "remaining_time": "0:34:30", "throughput": 1179.58, "total_tokens": 1281024}
49
- {"current_steps": 490, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.0538213132400431, "percentage": 35.13, "elapsed_time": "0:18:28", "remaining_time": "0:34:06", "throughput": 1180.51, "total_tokens": 1308032}
50
- {"current_steps": 500, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.0753498385360603, "percentage": 35.84, "elapsed_time": "0:18:49", "remaining_time": "0:33:42", "throughput": 1181.93, "total_tokens": 1335328}
51
- {"current_steps": 510, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.0968783638320776, "percentage": 36.56, "elapsed_time": "0:19:11", "remaining_time": "0:33:17", "throughput": 1182.83, "total_tokens": 1361888}
52
- {"current_steps": 520, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.1184068891280947, "percentage": 37.28, "elapsed_time": "0:19:32", "remaining_time": "0:32:53", "throughput": 1183.95, "total_tokens": 1388768}
53
- {"current_steps": 530, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.1399354144241118, "percentage": 37.99, "elapsed_time": "0:19:54", "remaining_time": "0:32:29", "throughput": 1184.58, "total_tokens": 1414912}
54
- {"current_steps": 540, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.1614639397201292, "percentage": 38.71, "elapsed_time": "0:20:15", "remaining_time": "0:32:05", "throughput": 1185.49, "total_tokens": 1441440}
55
- {"current_steps": 550, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.1829924650161463, "percentage": 39.43, "elapsed_time": "0:20:37", "remaining_time": "0:31:41", "throughput": 1186.58, "total_tokens": 1468864}
56
- {"current_steps": 560, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.2045209903121636, "percentage": 40.14, "elapsed_time": "0:20:59", "remaining_time": "0:31:17", "throughput": 1187.56, "total_tokens": 1495616}
57
- {"current_steps": 570, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.2260495156081808, "percentage": 40.86, "elapsed_time": "0:21:20", "remaining_time": "0:30:53", "throughput": 1188.21, "total_tokens": 1521856}
58
- {"current_steps": 580, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.247578040904198, "percentage": 41.58, "elapsed_time": "0:21:42", "remaining_time": "0:30:29", "throughput": 1189.17, "total_tokens": 1548640}
59
- {"current_steps": 590, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.2691065662002152, "percentage": 42.29, "elapsed_time": "0:22:03", "remaining_time": "0:30:06", "throughput": 1189.9, "total_tokens": 1575040}
60
- {"current_steps": 600, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.2906350914962326, "percentage": 43.01, "elapsed_time": "0:22:25", "remaining_time": "0:29:42", "throughput": 1190.01, "total_tokens": 1601280}
61
- {"current_steps": 610, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.3121636167922497, "percentage": 43.73, "elapsed_time": "0:22:47", "remaining_time": "0:29:19", "throughput": 1190.97, "total_tokens": 1628416}
62
- {"current_steps": 620, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.333692142088267, "percentage": 44.44, "elapsed_time": "0:23:08", "remaining_time": "0:28:55", "throughput": 1191.46, "total_tokens": 1654400}
63
- {"current_steps": 630, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.3552206673842842, "percentage": 45.16, "elapsed_time": "0:23:30", "remaining_time": "0:28:32", "throughput": 1192.4, "total_tokens": 1681632}
64
- {"current_steps": 640, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.3767491926803013, "percentage": 45.88, "elapsed_time": "0:23:51", "remaining_time": "0:28:09", "throughput": 1193.2, "total_tokens": 1708480}
65
- {"current_steps": 650, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.3982777179763186, "percentage": 46.59, "elapsed_time": "0:24:13", "remaining_time": "0:27:45", "throughput": 1193.67, "total_tokens": 1734816}
66
- {"current_steps": 660, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.419806243272336, "percentage": 47.31, "elapsed_time": "0:24:34", "remaining_time": "0:27:22", "throughput": 1194.14, "total_tokens": 1761248}
67
- {"current_steps": 670, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.441334768568353, "percentage": 48.03, "elapsed_time": "0:24:56", "remaining_time": "0:26:59", "throughput": 1194.86, "total_tokens": 1788064}
68
- {"current_steps": 680, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.4628632938643702, "percentage": 48.75, "elapsed_time": "0:25:18", "remaining_time": "0:26:36", "throughput": 1195.74, "total_tokens": 1815360}
69
- {"current_steps": 690, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.4843918191603875, "percentage": 49.46, "elapsed_time": "0:25:39", "remaining_time": "0:26:13", "throughput": 1196.39, "total_tokens": 1842112}
70
- {"current_steps": 700, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.5059203444564049, "percentage": 50.18, "elapsed_time": "0:26:01", "remaining_time": "0:25:50", "throughput": 1196.71, "total_tokens": 1868576}
71
- {"current_steps": 710, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.527448869752422, "percentage": 50.9, "elapsed_time": "0:26:23", "remaining_time": "0:25:27", "throughput": 1197.27, "total_tokens": 1895360}
72
- {"current_steps": 720, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.5489773950484391, "percentage": 51.61, "elapsed_time": "0:26:44", "remaining_time": "0:25:04", "throughput": 1197.93, "total_tokens": 1922272}
73
- {"current_steps": 730, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.5705059203444565, "percentage": 52.33, "elapsed_time": "0:27:05", "remaining_time": "0:24:41", "throughput": 1198.07, "total_tokens": 1947936}
74
- {"current_steps": 740, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.5920344456404736, "percentage": 53.05, "elapsed_time": "0:27:27", "remaining_time": "0:24:18", "throughput": 1198.57, "total_tokens": 1974528}
75
- {"current_steps": 750, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.6135629709364907, "percentage": 53.76, "elapsed_time": "0:27:49", "remaining_time": "0:23:55", "throughput": 1199.05, "total_tokens": 2001376}
76
- {"current_steps": 760, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.635091496232508, "percentage": 54.48, "elapsed_time": "0:28:10", "remaining_time": "0:23:32", "throughput": 1199.34, "total_tokens": 2027552}
77
- {"current_steps": 770, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.6566200215285254, "percentage": 55.2, "elapsed_time": "0:28:32", "remaining_time": "0:23:09", "throughput": 1199.95, "total_tokens": 2054592}
78
- {"current_steps": 780, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.6781485468245425, "percentage": 55.91, "elapsed_time": "0:28:54", "remaining_time": "0:22:47", "throughput": 1200.7, "total_tokens": 2082080}
79
- {"current_steps": 790, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.6996770721205596, "percentage": 56.63, "elapsed_time": "0:29:15", "remaining_time": "0:22:24", "throughput": 1200.79, "total_tokens": 2107424}
80
- {"current_steps": 800, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.721205597416577, "percentage": 57.35, "elapsed_time": "0:29:36", "remaining_time": "0:22:01", "throughput": 1201.33, "total_tokens": 2134176}
81
- {"current_steps": 810, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.7427341227125943, "percentage": 58.06, "elapsed_time": "0:29:58", "remaining_time": "0:21:38", "throughput": 1201.82, "total_tokens": 2161056}
82
- {"current_steps": 820, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.7642626480086114, "percentage": 58.78, "elapsed_time": "0:30:19", "remaining_time": "0:21:16", "throughput": 1202.38, "total_tokens": 2188064}
83
- {"current_steps": 830, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.7857911733046286, "percentage": 59.5, "elapsed_time": "0:30:41", "remaining_time": "0:20:53", "throughput": 1202.77, "total_tokens": 2214816}
84
- {"current_steps": 840, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.807319698600646, "percentage": 60.22, "elapsed_time": "0:31:03", "remaining_time": "0:20:31", "throughput": 1203.32, "total_tokens": 2241984}
85
- {"current_steps": 850, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.8288482238966632, "percentage": 60.93, "elapsed_time": "0:31:24", "remaining_time": "0:20:08", "throughput": 1203.67, "total_tokens": 2268480}
86
- {"current_steps": 860, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.8503767491926801, "percentage": 61.65, "elapsed_time": "0:31:46", "remaining_time": "0:19:46", "throughput": 1204.12, "total_tokens": 2295648}
87
- {"current_steps": 870, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.8719052744886975, "percentage": 62.37, "elapsed_time": "0:32:08", "remaining_time": "0:19:23", "throughput": 1204.6, "total_tokens": 2322752}
88
- {"current_steps": 880, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.8934337997847148, "percentage": 63.08, "elapsed_time": "0:32:29", "remaining_time": "0:19:01", "throughput": 1204.95, "total_tokens": 2349440}
89
- {"current_steps": 890, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.914962325080732, "percentage": 63.8, "elapsed_time": "0:32:51", "remaining_time": "0:18:38", "throughput": 1205.2, "total_tokens": 2375744}
90
- {"current_steps": 900, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.936490850376749, "percentage": 64.52, "elapsed_time": "0:33:12", "remaining_time": "0:18:15", "throughput": 1205.4, "total_tokens": 2401952}
91
- {"current_steps": 910, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.9580193756727664, "percentage": 65.23, "elapsed_time": "0:33:34", "remaining_time": "0:17:53", "throughput": 1205.52, "total_tokens": 2428384}
92
- {"current_steps": 920, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 1.9795479009687837, "percentage": 65.95, "elapsed_time": "0:33:56", "remaining_time": "0:17:31", "throughput": 1205.68, "total_tokens": 2455040}
93
- {"current_steps": 930, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.0, "percentage": 66.67, "elapsed_time": "0:34:17", "remaining_time": "0:17:08", "throughput": 1205.99, "total_tokens": 2480832}
94
- {"current_steps": 940, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.0215285252960173, "percentage": 67.38, "elapsed_time": "0:34:38", "remaining_time": "0:16:46", "throughput": 1206.21, "total_tokens": 2507296}
95
- {"current_steps": 950, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.0430570505920342, "percentage": 68.1, "elapsed_time": "0:35:00", "remaining_time": "0:16:23", "throughput": 1206.49, "total_tokens": 2534048}
96
- {"current_steps": 960, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.0645855758880516, "percentage": 68.82, "elapsed_time": "0:35:21", "remaining_time": "0:16:01", "throughput": 1206.81, "total_tokens": 2560672}
97
- {"current_steps": 970, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.086114101184069, "percentage": 69.53, "elapsed_time": "0:35:43", "remaining_time": "0:15:39", "throughput": 1207.14, "total_tokens": 2587520}
98
- {"current_steps": 980, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.1076426264800863, "percentage": 70.25, "elapsed_time": "0:36:05", "remaining_time": "0:15:16", "throughput": 1207.51, "total_tokens": 2614624}
99
- {"current_steps": 990, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.129171151776103, "percentage": 70.97, "elapsed_time": "0:36:26", "remaining_time": "0:14:54", "throughput": 1207.73, "total_tokens": 2641056}
100
- {"current_steps": 1000, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.1506996770721205, "percentage": 71.68, "elapsed_time": "0:36:48", "remaining_time": "0:14:32", "throughput": 1208.13, "total_tokens": 2668128}
101
- {"current_steps": 1010, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.172228202368138, "percentage": 72.4, "elapsed_time": "0:37:16", "remaining_time": "0:14:12", "throughput": 1205.27, "total_tokens": 2695040}
102
- {"current_steps": 1020, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.193756727664155, "percentage": 73.12, "elapsed_time": "0:37:37", "remaining_time": "0:13:50", "throughput": 1205.69, "total_tokens": 2722176}
103
- {"current_steps": 1030, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.215285252960172, "percentage": 73.84, "elapsed_time": "0:37:59", "remaining_time": "0:13:27", "throughput": 1206.03, "total_tokens": 2749120}
104
- {"current_steps": 1040, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.2368137782561894, "percentage": 74.55, "elapsed_time": "0:38:21", "remaining_time": "0:13:05", "throughput": 1206.38, "total_tokens": 2776320}
105
- {"current_steps": 1050, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.2583423035522068, "percentage": 75.27, "elapsed_time": "0:38:42", "remaining_time": "0:12:43", "throughput": 1206.6, "total_tokens": 2802848}
106
- {"current_steps": 1060, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.2798708288482237, "percentage": 75.99, "elapsed_time": "0:39:04", "remaining_time": "0:12:20", "throughput": 1206.75, "total_tokens": 2829216}
107
- {"current_steps": 1070, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.301399354144241, "percentage": 76.7, "elapsed_time": "0:39:25", "remaining_time": "0:11:58", "throughput": 1206.94, "total_tokens": 2855456}
108
- {"current_steps": 1080, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.3229278794402584, "percentage": 77.42, "elapsed_time": "0:39:47", "remaining_time": "0:11:36", "throughput": 1207.12, "total_tokens": 2881760}
109
- {"current_steps": 1090, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.3444564047362757, "percentage": 78.14, "elapsed_time": "0:40:09", "remaining_time": "0:11:14", "throughput": 1207.58, "total_tokens": 2909440}
110
- {"current_steps": 1100, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.3659849300322926, "percentage": 78.85, "elapsed_time": "0:40:30", "remaining_time": "0:10:51", "throughput": 1207.74, "total_tokens": 2935712}
111
- {"current_steps": 1110, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.38751345532831, "percentage": 79.57, "elapsed_time": "0:40:52", "remaining_time": "0:10:29", "throughput": 1208.13, "total_tokens": 2962880}
112
- {"current_steps": 1120, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.4090419806243273, "percentage": 80.29, "elapsed_time": "0:41:14", "remaining_time": "0:10:07", "throughput": 1208.37, "total_tokens": 2990080}
113
- {"current_steps": 1130, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.4305705059203446, "percentage": 81.0, "elapsed_time": "0:41:36", "remaining_time": "0:09:45", "throughput": 1208.59, "total_tokens": 3016736}
114
- {"current_steps": 1140, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.4520990312163615, "percentage": 81.72, "elapsed_time": "0:41:57", "remaining_time": "0:09:23", "throughput": 1208.8, "total_tokens": 3043264}
115
- {"current_steps": 1150, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.473627556512379, "percentage": 82.44, "elapsed_time": "0:42:19", "remaining_time": "0:09:00", "throughput": 1209.15, "total_tokens": 3070304}
116
- {"current_steps": 1160, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.495156081808396, "percentage": 83.15, "elapsed_time": "0:42:40", "remaining_time": "0:08:38", "throughput": 1209.28, "total_tokens": 3096672}
117
- {"current_steps": 1170, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.5166846071044136, "percentage": 83.87, "elapsed_time": "0:43:02", "remaining_time": "0:08:16", "throughput": 1209.43, "total_tokens": 3123232}
118
- {"current_steps": 1180, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.5382131324004304, "percentage": 84.59, "elapsed_time": "0:43:23", "remaining_time": "0:07:54", "throughput": 1209.69, "total_tokens": 3149792}
119
- {"current_steps": 1190, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.559741657696448, "percentage": 85.3, "elapsed_time": "0:43:45", "remaining_time": "0:07:32", "throughput": 1210.06, "total_tokens": 3177152}
120
- {"current_steps": 1200, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.581270182992465, "percentage": 86.02, "elapsed_time": "0:44:07", "remaining_time": "0:07:10", "throughput": 1210.25, "total_tokens": 3203840}
121
- {"current_steps": 1210, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.602798708288482, "percentage": 86.74, "elapsed_time": "0:44:28", "remaining_time": "0:06:48", "throughput": 1210.48, "total_tokens": 3230720}
122
- {"current_steps": 1220, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.6243272335844994, "percentage": 87.46, "elapsed_time": "0:44:50", "remaining_time": "0:06:25", "throughput": 1210.54, "total_tokens": 3256544}
123
- {"current_steps": 1230, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.6458557588805167, "percentage": 88.17, "elapsed_time": "0:45:11", "remaining_time": "0:06:03", "throughput": 1210.76, "total_tokens": 3283136}
124
- {"current_steps": 1240, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.667384284176534, "percentage": 88.89, "elapsed_time": "0:45:33", "remaining_time": "0:05:41", "throughput": 1211.07, "total_tokens": 3310464}
125
- {"current_steps": 1250, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.6889128094725514, "percentage": 89.61, "elapsed_time": "0:45:54", "remaining_time": "0:05:19", "throughput": 1211.16, "total_tokens": 3336608}
126
- {"current_steps": 1260, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.7104413347685683, "percentage": 90.32, "elapsed_time": "0:46:16", "remaining_time": "0:04:57", "throughput": 1211.33, "total_tokens": 3363200}
127
- {"current_steps": 1270, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.7319698600645856, "percentage": 91.04, "elapsed_time": "0:46:38", "remaining_time": "0:04:35", "throughput": 1211.58, "total_tokens": 3390176}
128
- {"current_steps": 1280, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.7534983853606025, "percentage": 91.76, "elapsed_time": "0:46:59", "remaining_time": "0:04:13", "throughput": 1211.72, "total_tokens": 3416832}
129
- {"current_steps": 1290, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.77502691065662, "percentage": 92.47, "elapsed_time": "0:47:21", "remaining_time": "0:03:51", "throughput": 1211.92, "total_tokens": 3443264}
130
- {"current_steps": 1300, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.7965554359526372, "percentage": 93.19, "elapsed_time": "0:47:42", "remaining_time": "0:03:29", "throughput": 1212.2, "total_tokens": 3470400}
131
- {"current_steps": 1310, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.8180839612486546, "percentage": 93.91, "elapsed_time": "0:48:04", "remaining_time": "0:03:07", "throughput": 1212.47, "total_tokens": 3497440}
132
- {"current_steps": 1320, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.839612486544672, "percentage": 94.62, "elapsed_time": "0:48:26", "remaining_time": "0:02:45", "throughput": 1212.63, "total_tokens": 3523968}
133
- {"current_steps": 1330, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.861141011840689, "percentage": 95.34, "elapsed_time": "0:48:47", "remaining_time": "0:02:23", "throughput": 1212.9, "total_tokens": 3550816}
134
- {"current_steps": 1340, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.882669537136706, "percentage": 96.06, "elapsed_time": "0:49:09", "remaining_time": "0:02:01", "throughput": 1212.98, "total_tokens": 3577248}
135
- {"current_steps": 1350, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.9041980624327235, "percentage": 96.77, "elapsed_time": "0:49:30", "remaining_time": "0:01:39", "throughput": 1213.05, "total_tokens": 3603488}
136
- {"current_steps": 1360, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.9257265877287404, "percentage": 97.49, "elapsed_time": "0:49:52", "remaining_time": "0:01:17", "throughput": 1213.26, "total_tokens": 3630336}
137
- {"current_steps": 1370, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.9472551130247577, "percentage": 98.21, "elapsed_time": "0:50:13", "remaining_time": "0:00:54", "throughput": 1213.35, "total_tokens": 3656832}
138
- {"current_steps": 1380, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.968783638320775, "percentage": 98.92, "elapsed_time": "0:50:35", "remaining_time": "0:00:32", "throughput": 1213.51, "total_tokens": 3683488}
139
- {"current_steps": 1390, "total_steps": 1395, "loss": 0.0, "lr": 3e-05, "epoch": 2.9903121636167924, "percentage": 99.64, "elapsed_time": "0:50:56", "remaining_time": "0:00:10", "throughput": 1213.75, "total_tokens": 3710400}
140
- {"current_steps": 1395, "total_steps": 1395, "epoch": 3.0, "percentage": 100.0, "elapsed_time": "0:51:12", "remaining_time": "0:00:00", "throughput": 1211.55, "total_tokens": 3722368}
 
1
+ {"current_steps": 10, "total_steps": 1395, "loss": 1.7834, "lr": 9.998973021172564e-06, "epoch": 0.021528525296017224, "percentage": 0.72, "elapsed_time": "0:01:04", "remaining_time": "2:28:36", "throughput": 677.99, "total_tokens": 43648}
2
+ {"current_steps": 20, "total_steps": 1395, "loss": 0.7676, "lr": 9.995423512524277e-06, "epoch": 0.04305705059203445, "percentage": 1.43, "elapsed_time": "0:01:35", "remaining_time": "1:49:04", "throughput": 914.74, "total_tokens": 87072}
3
+ {"current_steps": 30, "total_steps": 1395, "loss": 0.5817, "lr": 9.98934059499448e-06, "epoch": 0.06458557588805167, "percentage": 2.15, "elapsed_time": "0:02:06", "remaining_time": "1:35:55", "throughput": 1039.71, "total_tokens": 131520}
4
+ {"current_steps": 40, "total_steps": 1395, "loss": 0.3531, "lr": 9.980727353510257e-06, "epoch": 0.0861141011840689, "percentage": 2.87, "elapsed_time": "0:02:37", "remaining_time": "1:29:00", "throughput": 1114.29, "total_tokens": 175680}
5
+ {"current_steps": 50, "total_steps": 1395, "loss": 0.3352, "lr": 9.969588156242282e-06, "epoch": 0.10764262648008611, "percentage": 3.58, "elapsed_time": "0:03:08", "remaining_time": "1:24:36", "throughput": 1163.66, "total_tokens": 219584}
6
+ {"current_steps": 60, "total_steps": 1395, "loss": 0.2298, "lr": 9.95592865238951e-06, "epoch": 0.12917115177610333, "percentage": 4.3, "elapsed_time": "0:03:39", "remaining_time": "1:21:28", "throughput": 1198.88, "total_tokens": 263392}
7
+ {"current_steps": 70, "total_steps": 1395, "loss": 0.1981, "lr": 9.939755769314215e-06, "epoch": 0.15069967707212056, "percentage": 5.02, "elapsed_time": "0:04:10", "remaining_time": "1:19:03", "throughput": 1224.72, "total_tokens": 306912}
8
+ {"current_steps": 80, "total_steps": 1395, "loss": 0.1755, "lr": 9.9210777090288e-06, "epoch": 0.1722282023681378, "percentage": 5.73, "elapsed_time": "0:04:41", "remaining_time": "1:17:02", "throughput": 1243.9, "total_tokens": 349824}
9
+ {"current_steps": 90, "total_steps": 1395, "loss": 0.1791, "lr": 9.899903944036185e-06, "epoch": 0.193756727664155, "percentage": 6.45, "elapsed_time": "0:05:12", "remaining_time": "1:15:26", "throughput": 1260.94, "total_tokens": 393664}
10
+ {"current_steps": 100, "total_steps": 1395, "loss": 0.2051, "lr": 9.87624521252587e-06, "epoch": 0.21528525296017223, "percentage": 7.17, "elapsed_time": "0:05:43", "remaining_time": "1:14:06", "throughput": 1275.56, "total_tokens": 437952}
11
+ {"current_steps": 110, "total_steps": 1395, "loss": 0.1912, "lr": 9.850113512928094e-06, "epoch": 0.23681377825618946, "percentage": 7.89, "elapsed_time": "0:06:14", "remaining_time": "1:12:51", "throughput": 1286.52, "total_tokens": 481472}
12
+ {"current_steps": 120, "total_steps": 1395, "loss": 0.1637, "lr": 9.821522097828884e-06, "epoch": 0.25834230355220666, "percentage": 8.6, "elapsed_time": "0:06:45", "remaining_time": "1:11:47", "throughput": 1296.09, "total_tokens": 525472}
13
+ {"current_steps": 130, "total_steps": 1395, "loss": 0.1537, "lr": 9.790485467249065e-06, "epoch": 0.2798708288482239, "percentage": 9.32, "elapsed_time": "0:07:16", "remaining_time": "1:10:47", "throughput": 1305.22, "total_tokens": 569696}
14
+ {"current_steps": 140, "total_steps": 1395, "loss": 0.1846, "lr": 9.757019361290621e-06, "epoch": 0.3013993541442411, "percentage": 10.04, "elapsed_time": "0:07:47", "remaining_time": "1:09:51", "throughput": 1312.61, "total_tokens": 613760}
15
+ {"current_steps": 150, "total_steps": 1395, "loss": 0.1872, "lr": 9.721140752154182e-06, "epoch": 0.32292787944025836, "percentage": 10.75, "elapsed_time": "0:08:18", "remaining_time": "1:08:58", "throughput": 1319.26, "total_tokens": 657824}
16
+ {"current_steps": 160, "total_steps": 1395, "loss": 0.1372, "lr": 9.682867835531624e-06, "epoch": 0.3444564047362756, "percentage": 11.47, "elapsed_time": "0:08:49", "remaining_time": "1:08:08", "throughput": 1324.79, "total_tokens": 701760}
17
+ {"current_steps": 170, "total_steps": 1395, "loss": 0.2028, "lr": 9.642220021378212e-06, "epoch": 0.36598493003229277, "percentage": 12.19, "elapsed_time": "0:09:20", "remaining_time": "1:07:18", "throughput": 1329.47, "total_tokens": 745184}
18
+ {"current_steps": 180, "total_steps": 1395, "loss": 0.1765, "lr": 9.59921792406891e-06, "epoch": 0.38751345532831, "percentage": 12.9, "elapsed_time": "0:09:51", "remaining_time": "1:06:33", "throughput": 1334.07, "total_tokens": 789216}
19
+ {"current_steps": 190, "total_steps": 1395, "loss": 0.1882, "lr": 9.553883351943882e-06, "epoch": 0.40904198062432723, "percentage": 13.62, "elapsed_time": "0:10:22", "remaining_time": "1:05:48", "throughput": 1337.87, "total_tokens": 832960}
20
+ {"current_steps": 200, "total_steps": 1395, "loss": 0.1336, "lr": 9.506239296248497e-06, "epoch": 0.43057050592034446, "percentage": 14.34, "elapsed_time": "0:10:54", "remaining_time": "1:05:08", "throughput": 1341.84, "total_tokens": 877664}
21
+ {"current_steps": 210, "total_steps": 1395, "loss": 0.1521, "lr": 9.456309919473384e-06, "epoch": 0.4520990312163617, "percentage": 15.05, "elapsed_time": "0:11:25", "remaining_time": "1:04:26", "throughput": 1345.07, "total_tokens": 921536}
22
+ {"current_steps": 220, "total_steps": 1395, "loss": 0.1864, "lr": 9.404120543100553e-06, "epoch": 0.4736275565123789, "percentage": 15.77, "elapsed_time": "0:11:56", "remaining_time": "1:03:47", "throughput": 1346.89, "total_tokens": 965344}
23
+ {"current_steps": 230, "total_steps": 1395, "loss": 0.1625, "lr": 9.34969763476168e-06, "epoch": 0.4951560818083961, "percentage": 16.49, "elapsed_time": "0:12:27", "remaining_time": "1:03:06", "throughput": 1349.36, "total_tokens": 1008672}
24
+ {"current_steps": 240, "total_steps": 1395, "loss": 0.1456, "lr": 9.293068794815175e-06, "epoch": 0.5166846071044133, "percentage": 17.2, "elapsed_time": "0:12:58", "remaining_time": "1:02:25", "throughput": 1351.59, "total_tokens": 1051936}
25
+ {"current_steps": 250, "total_steps": 1395, "loss": 0.165, "lr": 9.234262742348764e-06, "epoch": 0.5382131324004306, "percentage": 17.92, "elapsed_time": "0:13:29", "remaining_time": "1:01:46", "throughput": 1354.07, "total_tokens": 1095904}
26
+ {"current_steps": 260, "total_steps": 1395, "loss": 0.1487, "lr": 9.17330930061471e-06, "epoch": 0.5597416576964478, "percentage": 18.64, "elapsed_time": "0:14:00", "remaining_time": "1:01:09", "throughput": 1356.35, "total_tokens": 1140064}
27
+ {"current_steps": 270, "total_steps": 1395, "loss": 0.1687, "lr": 9.11023938190509e-06, "epoch": 0.581270182992465, "percentage": 19.35, "elapsed_time": "0:14:31", "remaining_time": "1:00:31", "throughput": 1358.32, "total_tokens": 1183872}
28
+ {"current_steps": 280, "total_steps": 1395, "loss": 0.1511, "lr": 9.045084971874738e-06, "epoch": 0.6027987082884823, "percentage": 20.07, "elapsed_time": "0:15:03", "remaining_time": "0:59:56", "throughput": 1360.35, "total_tokens": 1228544}
29
+ {"current_steps": 290, "total_steps": 1395, "loss": 0.184, "lr": 8.977879113319847e-06, "epoch": 0.6243272335844995, "percentage": 20.79, "elapsed_time": "0:15:34", "remaining_time": "0:59:19", "throughput": 1361.79, "total_tokens": 1271968}
30
+ {"current_steps": 300, "total_steps": 1395, "loss": 0.1305, "lr": 8.90865588942046e-06, "epoch": 0.6458557588805167, "percentage": 21.51, "elapsed_time": "0:16:05", "remaining_time": "0:58:42", "throughput": 1363.59, "total_tokens": 1316096}
31
+ {"current_steps": 310, "total_steps": 1395, "loss": 0.1405, "lr": 8.83745040645531e-06, "epoch": 0.667384284176534, "percentage": 22.22, "elapsed_time": "0:16:36", "remaining_time": "0:58:07", "throughput": 1365.17, "total_tokens": 1360256}
32
+ {"current_steps": 320, "total_steps": 1395, "loss": 0.1651, "lr": 8.764298775997823e-06, "epoch": 0.6889128094725512, "percentage": 22.94, "elapsed_time": "0:17:07", "remaining_time": "0:57:31", "throughput": 1366.48, "total_tokens": 1404064}
33
+ {"current_steps": 330, "total_steps": 1395, "loss": 0.1519, "lr": 8.68923809660227e-06, "epoch": 0.7104413347685683, "percentage": 23.66, "elapsed_time": "0:17:38", "remaining_time": "0:56:56", "throughput": 1367.92, "total_tokens": 1448256}
34
+ {"current_steps": 340, "total_steps": 1395, "loss": 0.1574, "lr": 8.612306434989395e-06, "epoch": 0.7319698600645855, "percentage": 24.37, "elapsed_time": "0:18:09", "remaining_time": "0:56:22", "throughput": 1369.22, "total_tokens": 1492448}
35
+ {"current_steps": 350, "total_steps": 1395, "loss": 0.1587, "lr": 8.53354280674102e-06, "epoch": 0.7534983853606028, "percentage": 25.09, "elapsed_time": "0:18:41", "remaining_time": "0:55:48", "throughput": 1370.83, "total_tokens": 1537440}
36
+ {"current_steps": 360, "total_steps": 1395, "loss": 0.1513, "lr": 8.452987156513457e-06, "epoch": 0.77502691065662, "percentage": 25.81, "elapsed_time": "0:19:12", "remaining_time": "0:55:13", "throughput": 1371.83, "total_tokens": 1581280}
37
+ {"current_steps": 370, "total_steps": 1395, "loss": 0.1401, "lr": 8.370680337779737e-06, "epoch": 0.7965554359526372, "percentage": 26.52, "elapsed_time": "0:19:44", "remaining_time": "0:54:40", "throughput": 1372.77, "total_tokens": 1625824}
38
+ {"current_steps": 380, "total_steps": 1395, "loss": 0.1135, "lr": 8.286664092110935e-06, "epoch": 0.8180839612486545, "percentage": 27.24, "elapsed_time": "0:20:15", "remaining_time": "0:54:06", "throughput": 1373.73, "total_tokens": 1669472}
39
+ {"current_steps": 390, "total_steps": 1395, "loss": 0.1645, "lr": 8.200981028007095e-06, "epoch": 0.8396124865446717, "percentage": 27.96, "elapsed_time": "0:20:46", "remaining_time": "0:53:31", "throughput": 1374.92, "total_tokens": 1713312}
40
+ {"current_steps": 400, "total_steps": 1395, "loss": 0.1129, "lr": 8.11367459928851e-06, "epoch": 0.8611410118406889, "percentage": 28.67, "elapsed_time": "0:21:17", "remaining_time": "0:52:56", "throughput": 1375.83, "total_tokens": 1757056}
41
+ {"current_steps": 410, "total_steps": 1395, "loss": 0.1333, "lr": 8.024789083058289e-06, "epoch": 0.8826695371367062, "percentage": 29.39, "elapsed_time": "0:21:48", "remaining_time": "0:52:23", "throughput": 1376.82, "total_tokens": 1801632}
42
+ {"current_steps": 420, "total_steps": 1395, "loss": 0.1311, "lr": 7.934369557247397e-06, "epoch": 0.9041980624327234, "percentage": 30.11, "elapsed_time": "0:22:19", "remaining_time": "0:51:49", "throughput": 1377.63, "total_tokens": 1845280}
43
+ {"current_steps": 430, "total_steps": 1395, "loss": 0.1395, "lr": 7.842461877753575e-06, "epoch": 0.9257265877287406, "percentage": 30.82, "elapsed_time": "0:22:50", "remaining_time": "0:51:15", "throughput": 1378.55, "total_tokens": 1889472}
44
+ {"current_steps": 440, "total_steps": 1395, "loss": 0.1175, "lr": 7.7491126551857e-06, "epoch": 0.9472551130247578, "percentage": 31.54, "elapsed_time": "0:23:21", "remaining_time": "0:50:41", "throughput": 1379.32, "total_tokens": 1932832}
45
+ {"current_steps": 450, "total_steps": 1395, "loss": 0.1154, "lr": 7.654369231225398e-06, "epoch": 0.9687836383207751, "percentage": 32.26, "elapsed_time": "0:23:51", "remaining_time": "0:50:07", "throughput": 1379.96, "total_tokens": 1976000}
46
+ {"current_steps": 460, "total_steps": 1395, "loss": 0.1408, "lr": 7.5582796546179125e-06, "epoch": 0.9903121636167922, "percentage": 32.97, "elapsed_time": "0:24:23", "remaining_time": "0:49:33", "throughput": 1380.68, "total_tokens": 2019968}
47
+ {"current_steps": 470, "total_steps": 1395, "loss": 0.1126, "lr": 7.460892656804366e-06, "epoch": 1.0107642626480087, "percentage": 33.69, "elapsed_time": "0:24:52", "remaining_time": "0:48:57", "throughput": 1381.29, "total_tokens": 2061440}
48
+ {"current_steps": 480, "total_steps": 1395, "loss": 0.1329, "lr": 7.362257627207818e-06, "epoch": 1.0322927879440258, "percentage": 34.41, "elapsed_time": "0:25:23", "remaining_time": "0:48:23", "throughput": 1382.02, "total_tokens": 2105216}
49
+ {"current_steps": 490, "total_steps": 1395, "loss": 0.111, "lr": 7.2624245881856094e-06, "epoch": 1.0538213132400431, "percentage": 35.13, "elapsed_time": "0:25:54", "remaining_time": "0:47:51", "throughput": 1382.64, "total_tokens": 2149888}
50
+ {"current_steps": 500, "total_steps": 1395, "loss": 0.113, "lr": 7.161444169660723e-06, "epoch": 1.0753498385360603, "percentage": 35.84, "elapsed_time": "0:26:26", "remaining_time": "0:47:19", "throughput": 1383.36, "total_tokens": 2194304}
51
+ {"current_steps": 510, "total_steps": 1395, "loss": 0.1303, "lr": 7.059367583445034e-06, "epoch": 1.0968783638320776, "percentage": 36.56, "elapsed_time": "0:26:57", "remaining_time": "0:46:46", "throughput": 1384.03, "total_tokens": 2238080}
52
+ {"current_steps": 520, "total_steps": 1395, "loss": 0.1404, "lr": 6.956246597267438e-06, "epoch": 1.1184068891280947, "percentage": 37.28, "elapsed_time": "0:27:28", "remaining_time": "0:46:13", "throughput": 1384.6, "total_tokens": 2282368}
53
+ {"current_steps": 530, "total_steps": 1395, "loss": 0.0972, "lr": 6.852133508520057e-06, "epoch": 1.1399354144241118, "percentage": 37.99, "elapsed_time": "0:27:59", "remaining_time": "0:45:40", "throughput": 1385.09, "total_tokens": 2325984}
54
+ {"current_steps": 540, "total_steps": 1395, "loss": 0.1092, "lr": 6.747081117735829e-06, "epoch": 1.1614639397201292, "percentage": 38.71, "elapsed_time": "0:28:30", "remaining_time": "0:45:07", "throughput": 1385.58, "total_tokens": 2369664}
55
+ {"current_steps": 550, "total_steps": 1395, "loss": 0.1186, "lr": 6.641142701810932e-06, "epoch": 1.1829924650161463, "percentage": 39.43, "elapsed_time": "0:29:01", "remaining_time": "0:44:35", "throughput": 1386.0, "total_tokens": 2413312}
56
+ {"current_steps": 560, "total_steps": 1395, "loss": 0.1332, "lr": 6.534371986985618e-06, "epoch": 1.2045209903121636, "percentage": 40.14, "elapsed_time": "0:29:32", "remaining_time": "0:44:02", "throughput": 1386.55, "total_tokens": 2457120}
57
+ {"current_steps": 570, "total_steps": 1395, "loss": 0.1481, "lr": 6.426823121597169e-06, "epoch": 1.2260495156081808, "percentage": 40.86, "elapsed_time": "0:30:03", "remaining_time": "0:43:29", "throughput": 1386.93, "total_tokens": 2500736}
58
+ {"current_steps": 580, "total_steps": 1395, "loss": 0.1332, "lr": 6.318550648618785e-06, "epoch": 1.247578040904198, "percentage": 41.58, "elapsed_time": "0:30:34", "remaining_time": "0:42:57", "throughput": 1387.57, "total_tokens": 2545056}
59
+ {"current_steps": 590, "total_steps": 1395, "loss": 0.0978, "lr": 6.209609477998339e-06, "epoch": 1.2691065662002152, "percentage": 42.29, "elapsed_time": "0:31:04", "remaining_time": "0:42:24", "throughput": 1387.91, "total_tokens": 2588416}
60
+ {"current_steps": 600, "total_steps": 1395, "loss": 0.1176, "lr": 6.100054858811012e-06, "epoch": 1.2906350914962326, "percentage": 43.01, "elapsed_time": "0:31:36", "remaining_time": "0:41:52", "throughput": 1388.3, "total_tokens": 2632352}
61
+ {"current_steps": 610, "total_steps": 1395, "loss": 0.1279, "lr": 5.989942351239954e-06, "epoch": 1.3121636167922497, "percentage": 43.73, "elapsed_time": "0:32:07", "remaining_time": "0:41:20", "throughput": 1388.66, "total_tokens": 2676640}
62
+ {"current_steps": 620, "total_steps": 1395, "loss": 0.1407, "lr": 5.879327798399155e-06, "epoch": 1.333692142088267, "percentage": 44.44, "elapsed_time": "0:32:38", "remaining_time": "0:40:47", "throughput": 1388.98, "total_tokens": 2719968}
63
+ {"current_steps": 630, "total_steps": 1395, "loss": 0.1168, "lr": 5.768267298012841e-06, "epoch": 1.3552206673842842, "percentage": 45.16, "elapsed_time": "0:33:09", "remaining_time": "0:40:16", "throughput": 1389.35, "total_tokens": 2764352}
64
+ {"current_steps": 640, "total_steps": 1395, "loss": 0.1188, "lr": 5.656817173965733e-06, "epoch": 1.3767491926803013, "percentage": 45.88, "elapsed_time": "0:33:41", "remaining_time": "0:39:44", "throughput": 1389.81, "total_tokens": 2808832}
65
+ {"current_steps": 650, "total_steps": 1395, "loss": 0.1326, "lr": 5.545033947738624e-06, "epoch": 1.3982777179763186, "percentage": 46.59, "elapsed_time": "0:34:11", "remaining_time": "0:39:11", "throughput": 1390.15, "total_tokens": 2852192}
66
+ {"current_steps": 660, "total_steps": 1395, "loss": 0.1331, "lr": 5.4329743097437316e-06, "epoch": 1.419806243272336, "percentage": 47.31, "elapsed_time": "0:34:42", "remaining_time": "0:38:39", "throughput": 1390.61, "total_tokens": 2896256}
67
+ {"current_steps": 670, "total_steps": 1395, "loss": 0.1082, "lr": 5.320695090574386e-06, "epoch": 1.441334768568353, "percentage": 48.03, "elapsed_time": "0:35:13", "remaining_time": "0:38:07", "throughput": 1390.83, "total_tokens": 2939552}
68
+ {"current_steps": 680, "total_steps": 1395, "loss": 0.1184, "lr": 5.208253232183625e-06, "epoch": 1.4628632938643702, "percentage": 48.75, "elapsed_time": "0:35:44", "remaining_time": "0:37:35", "throughput": 1391.28, "total_tokens": 2984000}
69
+ {"current_steps": 690, "total_steps": 1395, "loss": 0.0942, "lr": 5.095705759006311e-06, "epoch": 1.4843918191603875, "percentage": 49.46, "elapsed_time": "0:36:16", "remaining_time": "0:37:03", "throughput": 1391.62, "total_tokens": 3028192}
70
+ {"current_steps": 700, "total_steps": 1395, "loss": 0.1204, "lr": 4.9831097490394195e-06, "epoch": 1.5059203444564049, "percentage": 50.18, "elapsed_time": "0:36:46", "remaining_time": "0:36:31", "throughput": 1391.78, "total_tokens": 3071392}
71
+ {"current_steps": 710, "total_steps": 1395, "loss": 0.1358, "lr": 4.870522304895164e-06, "epoch": 1.527448869752422, "percentage": 50.9, "elapsed_time": "0:37:17", "remaining_time": "0:35:58", "throughput": 1391.95, "total_tokens": 3114496}
72
+ {"current_steps": 720, "total_steps": 1395, "loss": 0.1313, "lr": 4.758000524841632e-06, "epoch": 1.5489773950484391, "percentage": 51.61, "elapsed_time": "0:37:48", "remaining_time": "0:35:26", "throughput": 1392.21, "total_tokens": 3158432}
73
+ {"current_steps": 730, "total_steps": 1395, "loss": 0.0879, "lr": 4.645601473845636e-06, "epoch": 1.5705059203444565, "percentage": 52.33, "elapsed_time": "0:38:19", "remaining_time": "0:34:54", "throughput": 1392.44, "total_tokens": 3201888}
74
+ {"current_steps": 740, "total_steps": 1395, "loss": 0.0977, "lr": 4.533382154632442e-06, "epoch": 1.5920344456404736, "percentage": 53.05, "elapsed_time": "0:38:50", "remaining_time": "0:34:22", "throughput": 1392.74, "total_tokens": 3245856}
75
+ {"current_steps": 750, "total_steps": 1395, "loss": 0.1483, "lr": 4.421399478777064e-06, "epoch": 1.6135629709364907, "percentage": 53.76, "elapsed_time": "0:39:21", "remaining_time": "0:33:51", "throughput": 1393.03, "total_tokens": 3290208}
76
+ {"current_steps": 760, "total_steps": 1395, "loss": 0.1285, "lr": 4.3097102378417985e-06, "epoch": 1.635091496232508, "percentage": 54.48, "elapsed_time": "0:39:52", "remaining_time": "0:33:19", "throughput": 1393.12, "total_tokens": 3333152}
77
+ {"current_steps": 770, "total_steps": 1395, "loss": 0.1475, "lr": 4.198371074574597e-06, "epoch": 1.6566200215285254, "percentage": 55.2, "elapsed_time": "0:40:23", "remaining_time": "0:32:47", "throughput": 1393.46, "total_tokens": 3377664}
78
+ {"current_steps": 780, "total_steps": 1395, "loss": 0.0904, "lr": 4.087438454182942e-06, "epoch": 1.6781485468245425, "percentage": 55.91, "elapsed_time": "0:40:55", "remaining_time": "0:32:16", "throughput": 1393.73, "total_tokens": 3422400}
79
+ {"current_steps": 790, "total_steps": 1395, "loss": 0.1199, "lr": 3.976968635697732e-06, "epoch": 1.6996770721205596, "percentage": 56.63, "elapsed_time": "0:41:26", "remaining_time": "0:31:44", "throughput": 1393.93, "total_tokens": 3465760}
80
+ {"current_steps": 800, "total_steps": 1395, "loss": 0.102, "lr": 3.867017643441746e-06, "epoch": 1.721205597416577, "percentage": 57.35, "elapsed_time": "0:41:57", "remaining_time": "0:31:12", "throughput": 1394.19, "total_tokens": 3509760}
81
+ {"current_steps": 810, "total_steps": 1395, "loss": 0.1194, "lr": 3.757641238617137e-06, "epoch": 1.7427341227125943, "percentage": 58.06, "elapsed_time": "0:42:29", "remaining_time": "0:30:41", "throughput": 1394.24, "total_tokens": 3554560}
82
+ {"current_steps": 820, "total_steps": 1395, "loss": 0.1507, "lr": 3.648894891026358e-06, "epoch": 1.7642626480086114, "percentage": 58.78, "elapsed_time": "0:43:01", "remaining_time": "0:30:09", "throughput": 1394.6, "total_tokens": 3599488}
83
+ {"current_steps": 830, "total_steps": 1395, "loss": 0.1015, "lr": 3.5408337509408764e-06, "epoch": 1.7857911733046286, "percentage": 59.5, "elapsed_time": "0:43:32", "remaining_time": "0:29:38", "throughput": 1394.81, "total_tokens": 3643680}
84
+ {"current_steps": 840, "total_steps": 1395, "loss": 0.1165, "lr": 3.4335126211319412e-06, "epoch": 1.807319698600646, "percentage": 60.22, "elapsed_time": "0:44:03", "remaining_time": "0:29:06", "throughput": 1395.1, "total_tokens": 3688160}
85
+ {"current_steps": 850, "total_steps": 1395, "loss": 0.0958, "lr": 3.32698592907757e-06, "epoch": 1.8288482238966632, "percentage": 60.93, "elapsed_time": "0:44:34", "remaining_time": "0:28:34", "throughput": 1395.22, "total_tokens": 3731392}
86
+ {"current_steps": 860, "total_steps": 1395, "loss": 0.1505, "lr": 3.2213076993598857e-06, "epoch": 1.8503767491926801, "percentage": 61.65, "elapsed_time": "0:45:06", "remaining_time": "0:28:03", "throughput": 1395.41, "total_tokens": 3776128}
87
+ {"current_steps": 870, "total_steps": 1395, "loss": 0.1003, "lr": 3.1165315262667535e-06, "epoch": 1.8719052744886975, "percentage": 62.37, "elapsed_time": "0:45:37", "remaining_time": "0:27:32", "throughput": 1395.71, "total_tokens": 3820896}
88
+ {"current_steps": 880, "total_steps": 1395, "loss": 0.1483, "lr": 3.012710546611659e-06, "epoch": 1.8934337997847148, "percentage": 63.08, "elapsed_time": "0:46:08", "remaining_time": "0:27:00", "throughput": 1395.87, "total_tokens": 3864704}
89
+ {"current_steps": 890, "total_steps": 1395, "loss": 0.117, "lr": 2.9098974127856e-06, "epoch": 1.914962325080732, "percentage": 63.8, "elapsed_time": "0:46:39", "remaining_time": "0:26:28", "throughput": 1396.08, "total_tokens": 3908544}
90
+ {"current_steps": 900, "total_steps": 1395, "loss": 0.1303, "lr": 2.8081442660546126e-06, "epoch": 1.936490850376749, "percentage": 64.52, "elapsed_time": "0:47:10", "remaining_time": "0:25:57", "throughput": 1396.22, "total_tokens": 3952576}
91
+ {"current_steps": 910, "total_steps": 1395, "loss": 0.0971, "lr": 2.7075027101165706e-06, "epoch": 1.9580193756727664, "percentage": 65.23, "elapsed_time": "0:47:42", "remaining_time": "0:25:25", "throughput": 1396.34, "total_tokens": 3996416}
92
+ {"current_steps": 920, "total_steps": 1395, "loss": 0.132, "lr": 2.6080237849305467e-06, "epoch": 1.9795479009687837, "percentage": 65.95, "elapsed_time": "0:48:13", "remaining_time": "0:24:53", "throughput": 1396.59, "total_tokens": 4040736}
93
+ {"current_steps": 930, "total_steps": 1395, "loss": 0.093, "lr": 2.5097579408321264e-06, "epoch": 2.0, "percentage": 66.67, "elapsed_time": "0:48:43", "remaining_time": "0:24:21", "throughput": 1396.82, "total_tokens": 4083200}
94
+ {"current_steps": 940, "total_steps": 1395, "loss": 0.1324, "lr": 2.4127550129477145e-06, "epoch": 2.0215285252960173, "percentage": 67.38, "elapsed_time": "0:49:14", "remaining_time": "0:23:49", "throughput": 1396.98, "total_tokens": 4127040}
95
+ {"current_steps": 950, "total_steps": 1395, "loss": 0.0841, "lr": 2.317064195920852e-06, "epoch": 2.0430570505920342, "percentage": 68.1, "elapsed_time": "0:49:45", "remaining_time": "0:23:18", "throughput": 1397.11, "total_tokens": 4170816}
96
+ {"current_steps": 960, "total_steps": 1395, "loss": 0.1138, "lr": 2.2227340189633508e-06, "epoch": 2.0645855758880516, "percentage": 68.82, "elapsed_time": "0:50:16", "remaining_time": "0:22:46", "throughput": 1397.24, "total_tokens": 4214272}
97
+ {"current_steps": 970, "total_steps": 1395, "loss": 0.0892, "lr": 2.1298123212439028e-06, "epoch": 2.086114101184069, "percentage": 69.53, "elapsed_time": "0:50:47", "remaining_time": "0:22:15", "throughput": 1397.46, "total_tokens": 4258592}
98
+ {"current_steps": 980, "total_steps": 1395, "loss": 0.1277, "lr": 2.0383462276266347e-06, "epoch": 2.1076426264800863, "percentage": 70.25, "elapsed_time": "0:51:18", "remaining_time": "0:21:43", "throughput": 1397.61, "total_tokens": 4302656}
99
+ {"current_steps": 990, "total_steps": 1395, "loss": 0.0968, "lr": 1.948382124771927e-06, "epoch": 2.129171151776103, "percentage": 70.97, "elapsed_time": "0:51:49", "remaining_time": "0:21:11", "throughput": 1397.71, "total_tokens": 4345888}
100
+ {"current_steps": 1000, "total_steps": 1395, "loss": 0.1226, "lr": 1.8599656376116026e-06, "epoch": 2.1506996770721205, "percentage": 71.68, "elapsed_time": "0:52:20", "remaining_time": "0:20:40", "throughput": 1397.94, "total_tokens": 4390528}
101
+ {"current_steps": 1010, "total_steps": 1395, "loss": 0.1201, "lr": 1.773141606210431e-06, "epoch": 2.172228202368138, "percentage": 72.4, "elapsed_time": "0:52:58", "remaining_time": "0:20:11", "throughput": 1395.31, "total_tokens": 4434784}
102
+ {"current_steps": 1020, "total_steps": 1395, "loss": 0.0966, "lr": 1.687954063025663e-06, "epoch": 2.193756727664155, "percentage": 73.12, "elapsed_time": "0:53:29", "remaining_time": "0:19:40", "throughput": 1395.47, "total_tokens": 4478976}
103
+ {"current_steps": 1030, "total_steps": 1395, "loss": 0.1143, "lr": 1.604446210576157e-06, "epoch": 2.215285252960172, "percentage": 73.84, "elapsed_time": "0:54:01", "remaining_time": "0:19:08", "throughput": 1395.66, "total_tokens": 4523616}
104
+ {"current_steps": 1040, "total_steps": 1395, "loss": 0.1114, "lr": 1.5226603995323897e-06, "epoch": 2.2368137782561894, "percentage": 74.55, "elapsed_time": "0:54:32", "remaining_time": "0:18:36", "throughput": 1395.8, "total_tokens": 4567264}
105
+ {"current_steps": 1050, "total_steps": 1395, "loss": 0.0981, "lr": 1.4426381072384866e-06, "epoch": 2.2583423035522068, "percentage": 75.27, "elapsed_time": "0:55:03", "remaining_time": "0:18:05", "throughput": 1395.88, "total_tokens": 4611104}
106
+ {"current_steps": 1060, "total_steps": 1395, "loss": 0.1135, "lr": 1.3644199166771531e-06, "epoch": 2.2798708288482237, "percentage": 75.99, "elapsed_time": "0:55:34", "remaining_time": "0:17:33", "throughput": 1396.01, "total_tokens": 4655040}
107
+ {"current_steps": 1070, "total_steps": 1395, "loss": 0.1081, "lr": 1.2880454958881794e-06, "epoch": 2.301399354144241, "percentage": 76.7, "elapsed_time": "0:56:05", "remaining_time": "0:17:02", "throughput": 1396.08, "total_tokens": 4698432}
108
+ {"current_steps": 1080, "total_steps": 1395, "loss": 0.0685, "lr": 1.2135535778509545e-06, "epoch": 2.3229278794402584, "percentage": 77.42, "elapsed_time": "0:56:36", "remaining_time": "0:16:30", "throughput": 1396.28, "total_tokens": 4742848}
109
+ {"current_steps": 1090, "total_steps": 1395, "loss": 0.0857, "lr": 1.1409819408411898e-06, "epoch": 2.3444564047362757, "percentage": 78.14, "elapsed_time": "0:57:07", "remaining_time": "0:15:59", "throughput": 1396.47, "total_tokens": 4786944}
110
+ {"current_steps": 1100, "total_steps": 1395, "loss": 0.1008, "lr": 1.070367389271823e-06, "epoch": 2.3659849300322926, "percentage": 78.85, "elapsed_time": "0:57:38", "remaining_time": "0:15:27", "throughput": 1396.6, "total_tokens": 4830624}
111
+ {"current_steps": 1110, "total_steps": 1395, "loss": 0.1137, "lr": 1.001745735027801e-06, "epoch": 2.38751345532831, "percentage": 79.57, "elapsed_time": "0:58:10", "remaining_time": "0:14:56", "throughput": 1396.71, "total_tokens": 4874944}
112
+ {"current_steps": 1120, "total_steps": 1395, "loss": 0.1038, "lr": 9.351517793042408e-07, "epoch": 2.4090419806243273, "percentage": 80.29, "elapsed_time": "0:58:41", "remaining_time": "0:14:24", "throughput": 1396.77, "total_tokens": 4918496}
113
+ {"current_steps": 1130, "total_steps": 1395, "loss": 0.1194, "lr": 8.706192949571262e-07, "epoch": 2.4305705059203446, "percentage": 81.0, "elapsed_time": "0:59:12", "remaining_time": "0:13:53", "throughput": 1396.84, "total_tokens": 4961920}
114
+ {"current_steps": 1140, "total_steps": 1395, "loss": 0.1161, "lr": 8.081810093755537e-07, "epoch": 2.4520990312163615, "percentage": 81.72, "elapsed_time": "0:59:43", "remaining_time": "0:13:21", "throughput": 1396.93, "total_tokens": 5005440}
115
+ {"current_steps": 1150, "total_steps": 1395, "loss": 0.1, "lr": 7.478685878841629e-07, "epoch": 2.473627556512379, "percentage": 82.44, "elapsed_time": "1:00:14", "remaining_time": "0:12:50", "throughput": 1397.05, "total_tokens": 5049344}
116
+ {"current_steps": 1160, "total_steps": 1395, "loss": 0.0996, "lr": 6.897126176841978e-07, "epoch": 2.495156081808396, "percentage": 83.15, "elapsed_time": "1:00:45", "remaining_time": "0:12:18", "throughput": 1397.15, "total_tokens": 5092896}
117
+ {"current_steps": 1170, "total_steps": 1395, "loss": 0.0944, "lr": 6.337425923413276e-07, "epoch": 2.5166846071044136, "percentage": 83.87, "elapsed_time": "1:01:16", "remaining_time": "0:11:46", "throughput": 1397.31, "total_tokens": 5136928}
118
+ {"current_steps": 1180, "total_steps": 1395, "loss": 0.08, "lr": 5.799868968281075e-07, "epoch": 2.5382131324004304, "percentage": 84.59, "elapsed_time": "1:01:47", "remaining_time": "0:11:15", "throughput": 1397.41, "total_tokens": 5180960}
119
+ {"current_steps": 1190, "total_steps": 1395, "loss": 0.0962, "lr": 5.284727931286526e-07, "epoch": 2.559741657696448, "percentage": 85.3, "elapsed_time": "1:02:18", "remaining_time": "0:10:44", "throughput": 1397.57, "total_tokens": 5225376}
120
+ {"current_steps": 1200, "total_steps": 1395, "loss": 0.094, "lr": 4.792264064128327e-07, "epoch": 2.581270182992465, "percentage": 86.02, "elapsed_time": "1:02:49", "remaining_time": "0:10:12", "throughput": 1397.63, "total_tokens": 5268992}
121
+ {"current_steps": 1210, "total_steps": 1395, "loss": 0.1005, "lr": 4.322727117869951e-07, "epoch": 2.602798708288482, "percentage": 86.74, "elapsed_time": "1:03:21", "remaining_time": "0:09:41", "throughput": 1397.77, "total_tokens": 5312992}
122
+ {"current_steps": 1220, "total_steps": 1395, "loss": 0.1167, "lr": 3.8763552162794983e-07, "epoch": 2.6243272335844994, "percentage": 87.46, "elapsed_time": "1:03:51", "remaining_time": "0:09:09", "throughput": 1397.85, "total_tokens": 5356448}
123
+ {"current_steps": 1230, "total_steps": 1395, "loss": 0.0907, "lr": 3.453374735066034e-07, "epoch": 2.6458557588805167, "percentage": 88.17, "elapsed_time": "1:04:23", "remaining_time": "0:08:38", "throughput": 1397.99, "total_tokens": 5400672}
124
+ {"current_steps": 1240, "total_steps": 1395, "loss": 0.1074, "lr": 3.054000187074224e-07, "epoch": 2.667384284176534, "percentage": 88.89, "elapsed_time": "1:04:54", "remaining_time": "0:08:06", "throughput": 1398.14, "total_tokens": 5444576}
125
+ {"current_steps": 1250, "total_steps": 1395, "loss": 0.1128, "lr": 2.678434113494882e-07, "epoch": 2.6889128094725514, "percentage": 89.61, "elapsed_time": "1:05:25", "remaining_time": "0:07:35", "throughput": 1398.24, "total_tokens": 5488160}
126
+ {"current_steps": 1260, "total_steps": 1395, "loss": 0.1016, "lr": 2.326866981147091e-07, "epoch": 2.7104413347685683, "percentage": 90.32, "elapsed_time": "1:05:56", "remaining_time": "0:07:03", "throughput": 1398.36, "total_tokens": 5532000}
127
+ {"current_steps": 1270, "total_steps": 1395, "loss": 0.1052, "lr": 1.999477085883711e-07, "epoch": 2.7319698600645856, "percentage": 91.04, "elapsed_time": "1:06:27", "remaining_time": "0:06:32", "throughput": 1398.46, "total_tokens": 5575808}
128
+ {"current_steps": 1280, "total_steps": 1395, "loss": 0.0918, "lr": 1.6964304621693516e-07, "epoch": 2.7534983853606025, "percentage": 91.76, "elapsed_time": "1:06:57", "remaining_time": "0:06:00", "throughput": 1398.56, "total_tokens": 5619200}
129
+ {"current_steps": 1290, "total_steps": 1395, "loss": 0.109, "lr": 1.4178807988766419e-07, "epoch": 2.77502691065662, "percentage": 92.47, "elapsed_time": "1:07:28", "remaining_time": "0:05:29", "throughput": 1398.61, "total_tokens": 5662656}
130
+ {"current_steps": 1300, "total_steps": 1395, "loss": 0.1224, "lr": 1.1639693613435921e-07, "epoch": 2.7965554359526372, "percentage": 93.19, "elapsed_time": "1:07:59", "remaining_time": "0:04:58", "throughput": 1398.72, "total_tokens": 5706656}
131
+ {"current_steps": 1310, "total_steps": 1395, "loss": 0.0992, "lr": 9.348249197313918e-08, "epoch": 2.8180839612486546, "percentage": 93.91, "elapsed_time": "1:08:31", "remaining_time": "0:04:26", "throughput": 1398.83, "total_tokens": 5751232}
132
+ {"current_steps": 1320, "total_steps": 1395, "loss": 0.107, "lr": 7.305636837191876e-08, "epoch": 2.839612486544672, "percentage": 94.62, "elapsed_time": "1:09:02", "remaining_time": "0:03:55", "throughput": 1398.91, "total_tokens": 5794976}
133
+ {"current_steps": 1330, "total_steps": 1395, "loss": 0.0944, "lr": 5.512892435687645e-08, "epoch": 2.861141011840689, "percentage": 95.34, "elapsed_time": "1:09:33", "remaining_time": "0:03:23", "throughput": 1398.97, "total_tokens": 5838368}
134
+ {"current_steps": 1340, "total_steps": 1395, "loss": 0.0867, "lr": 3.970925175892093e-08, "epoch": 2.882669537136706, "percentage": 96.06, "elapsed_time": "1:10:04", "remaining_time": "0:02:52", "throughput": 1399.03, "total_tokens": 5881984}
135
+ {"current_steps": 1350, "total_steps": 1395, "loss": 0.1075, "lr": 2.6805170602803297e-08, "epoch": 2.9041980624327235, "percentage": 96.77, "elapsed_time": "1:10:35", "remaining_time": "0:02:21", "throughput": 1399.15, "total_tokens": 5925664}
136
+ {"current_steps": 1360, "total_steps": 1395, "loss": 0.1042, "lr": 1.6423225141223854e-08, "epoch": 2.9257265877287404, "percentage": 97.49, "elapsed_time": "1:11:06", "remaining_time": "0:01:49", "throughput": 1399.23, "total_tokens": 5969408}
137
+ {"current_steps": 1370, "total_steps": 1395, "loss": 0.0964, "lr": 8.568680535939177e-09, "epoch": 2.9472551130247577, "percentage": 98.21, "elapsed_time": "1:11:37", "remaining_time": "0:01:18", "throughput": 1399.25, "total_tokens": 6012576}
138
+ {"current_steps": 1380, "total_steps": 1395, "loss": 0.0922, "lr": 3.2455201875586372e-09, "epoch": 2.968783638320775, "percentage": 98.92, "elapsed_time": "1:12:08", "remaining_time": "0:00:47", "throughput": 1399.11, "total_tokens": 6056000}
139
+ {"current_steps": 1390, "total_steps": 1395, "loss": 0.115, "lr": 4.5644371537756363e-10, "epoch": 2.9903121636167924, "percentage": 99.64, "elapsed_time": "1:12:39", "remaining_time": "0:00:15", "throughput": 1399.22, "total_tokens": 6100192}
140
+ {"current_steps": 1395, "total_steps": 1395, "epoch": 3.0, "percentage": 100.0, "elapsed_time": "1:12:59", "remaining_time": "0:00:00", "throughput": 1397.29, "total_tokens": 6120032}
trainer_state.json CHANGED
@@ -11,1408 +11,1408 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.021528525296017224,
14
- "grad_norm": NaN,
15
- "learning_rate": 3e-05,
16
- "loss": 0.0,
17
- "num_input_tokens_seen": 26560,
18
  "step": 10,
19
- "train_runtime": 72.1053,
20
- "train_tokens_per_second": 368.35
21
  },
22
  {
23
  "epoch": 0.04305705059203445,
24
- "grad_norm": NaN,
25
- "learning_rate": 3e-05,
26
- "loss": 0.0,
27
- "num_input_tokens_seen": 52672,
28
  "step": 20,
29
- "train_runtime": 93.4817,
30
- "train_tokens_per_second": 563.447
31
  },
32
  {
33
  "epoch": 0.06458557588805167,
34
- "grad_norm": NaN,
35
- "learning_rate": 3e-05,
36
- "loss": 0.0,
37
- "num_input_tokens_seen": 79360,
38
  "step": 30,
39
- "train_runtime": 115.1034,
40
- "train_tokens_per_second": 689.467
41
  },
42
  {
43
  "epoch": 0.0861141011840689,
44
- "grad_norm": NaN,
45
- "learning_rate": 3e-05,
46
- "loss": 0.0,
47
- "num_input_tokens_seen": 106432,
48
  "step": 40,
49
- "train_runtime": 136.9811,
50
- "train_tokens_per_second": 776.983
51
  },
52
  {
53
  "epoch": 0.10764262648008611,
54
- "grad_norm": NaN,
55
- "learning_rate": 3e-05,
56
- "loss": 0.0,
57
- "num_input_tokens_seen": 132992,
58
  "step": 50,
59
- "train_runtime": 158.4451,
60
- "train_tokens_per_second": 839.357
61
  },
62
  {
63
  "epoch": 0.12917115177610333,
64
- "grad_norm": NaN,
65
- "learning_rate": 3e-05,
66
- "loss": 0.0,
67
- "num_input_tokens_seen": 159936,
68
  "step": 60,
69
- "train_runtime": 180.1478,
70
- "train_tokens_per_second": 887.804
71
  },
72
  {
73
  "epoch": 0.15069967707212056,
74
- "grad_norm": NaN,
75
- "learning_rate": 3e-05,
76
- "loss": 0.0,
77
- "num_input_tokens_seen": 186624,
78
  "step": 70,
79
- "train_runtime": 201.6103,
80
- "train_tokens_per_second": 925.667
81
  },
82
  {
83
  "epoch": 0.1722282023681378,
84
- "grad_norm": NaN,
85
- "learning_rate": 3e-05,
86
- "loss": 0.0,
87
- "num_input_tokens_seen": 213216,
88
  "step": 80,
89
- "train_runtime": 223.2507,
90
- "train_tokens_per_second": 955.052
91
  },
92
  {
93
  "epoch": 0.193756727664155,
94
- "grad_norm": NaN,
95
- "learning_rate": 3e-05,
96
- "loss": 0.0,
97
- "num_input_tokens_seen": 239328,
98
  "step": 90,
99
- "train_runtime": 244.8417,
100
- "train_tokens_per_second": 977.481
101
  },
102
  {
103
  "epoch": 0.21528525296017223,
104
- "grad_norm": NaN,
105
- "learning_rate": 3e-05,
106
- "loss": 0.0,
107
- "num_input_tokens_seen": 265920,
108
  "step": 100,
109
- "train_runtime": 266.376,
110
- "train_tokens_per_second": 998.288
111
  },
112
  {
113
  "epoch": 0.23681377825618946,
114
- "grad_norm": NaN,
115
- "learning_rate": 3e-05,
116
- "loss": 0.0,
117
- "num_input_tokens_seen": 292288,
118
  "step": 110,
119
- "train_runtime": 287.9016,
120
- "train_tokens_per_second": 1015.236
121
  },
122
  {
123
  "epoch": 0.25834230355220666,
124
- "grad_norm": NaN,
125
- "learning_rate": 3e-05,
126
- "loss": 0.0,
127
- "num_input_tokens_seen": 319264,
128
  "step": 120,
129
- "train_runtime": 309.7609,
130
- "train_tokens_per_second": 1030.679
131
  },
132
  {
133
  "epoch": 0.2798708288482239,
134
- "grad_norm": NaN,
135
- "learning_rate": 3e-05,
136
- "loss": 0.0,
137
- "num_input_tokens_seen": 346144,
138
  "step": 130,
139
- "train_runtime": 331.4402,
140
- "train_tokens_per_second": 1044.363
141
  },
142
  {
143
  "epoch": 0.3013993541442411,
144
- "grad_norm": NaN,
145
- "learning_rate": 3e-05,
146
- "loss": 0.0,
147
- "num_input_tokens_seen": 372800,
148
  "step": 140,
149
- "train_runtime": 353.0058,
150
- "train_tokens_per_second": 1056.073
151
  },
152
  {
153
  "epoch": 0.32292787944025836,
154
- "grad_norm": NaN,
155
- "learning_rate": 3e-05,
156
- "loss": 0.0,
157
- "num_input_tokens_seen": 399552,
158
  "step": 150,
159
- "train_runtime": 374.6224,
160
- "train_tokens_per_second": 1066.546
161
  },
162
  {
163
  "epoch": 0.3444564047362756,
164
- "grad_norm": NaN,
165
- "learning_rate": 3e-05,
166
- "loss": 0.0,
167
- "num_input_tokens_seen": 426464,
168
  "step": 160,
169
- "train_runtime": 396.271,
170
- "train_tokens_per_second": 1076.193
171
  },
172
  {
173
  "epoch": 0.36598493003229277,
174
- "grad_norm": NaN,
175
- "learning_rate": 3e-05,
176
- "loss": 0.0,
177
- "num_input_tokens_seen": 452672,
178
  "step": 170,
179
- "train_runtime": 417.6737,
180
- "train_tokens_per_second": 1083.793
181
  },
182
  {
183
  "epoch": 0.38751345532831,
184
- "grad_norm": NaN,
185
- "learning_rate": 3e-05,
186
- "loss": 0.0,
187
- "num_input_tokens_seen": 479136,
188
  "step": 180,
189
- "train_runtime": 439.2321,
190
- "train_tokens_per_second": 1090.849
191
  },
192
  {
193
  "epoch": 0.40904198062432723,
194
- "grad_norm": NaN,
195
- "learning_rate": 3e-05,
196
- "loss": 0.0,
197
- "num_input_tokens_seen": 505728,
198
  "step": 190,
199
- "train_runtime": 460.7964,
200
- "train_tokens_per_second": 1097.508
201
  },
202
  {
203
  "epoch": 0.43057050592034446,
204
- "grad_norm": NaN,
205
- "learning_rate": 3e-05,
206
- "loss": 0.0,
207
- "num_input_tokens_seen": 532576,
208
  "step": 200,
209
- "train_runtime": 482.3668,
210
- "train_tokens_per_second": 1104.089
211
  },
212
  {
213
  "epoch": 0.4520990312163617,
214
- "grad_norm": NaN,
215
- "learning_rate": 3e-05,
216
- "loss": 0.0,
217
- "num_input_tokens_seen": 559168,
218
  "step": 210,
219
- "train_runtime": 503.9477,
220
- "train_tokens_per_second": 1109.575
221
  },
222
  {
223
  "epoch": 0.4736275565123789,
224
- "grad_norm": NaN,
225
- "learning_rate": 3e-05,
226
- "loss": 0.0,
227
- "num_input_tokens_seen": 586144,
228
  "step": 220,
229
- "train_runtime": 525.6286,
230
- "train_tokens_per_second": 1115.13
231
  },
232
  {
233
  "epoch": 0.4951560818083961,
234
- "grad_norm": NaN,
235
- "learning_rate": 3e-05,
236
- "loss": 0.0,
237
- "num_input_tokens_seen": 612416,
238
  "step": 230,
239
- "train_runtime": 547.0447,
240
- "train_tokens_per_second": 1119.499
241
  },
242
  {
243
  "epoch": 0.5166846071044133,
244
- "grad_norm": NaN,
245
- "learning_rate": 3e-05,
246
- "loss": 0.0,
247
- "num_input_tokens_seen": 639584,
248
  "step": 240,
249
- "train_runtime": 568.7823,
250
- "train_tokens_per_second": 1124.479
251
  },
252
  {
253
  "epoch": 0.5382131324004306,
254
- "grad_norm": NaN,
255
- "learning_rate": 3e-05,
256
- "loss": 0.0,
257
- "num_input_tokens_seen": 665952,
258
  "step": 250,
259
- "train_runtime": 590.0539,
260
- "train_tokens_per_second": 1128.629
261
  },
262
  {
263
  "epoch": 0.5597416576964478,
264
- "grad_norm": NaN,
265
- "learning_rate": 3e-05,
266
- "loss": 0.0,
267
- "num_input_tokens_seen": 693440,
268
  "step": 260,
269
- "train_runtime": 611.9275,
270
- "train_tokens_per_second": 1133.206
271
  },
272
  {
273
  "epoch": 0.581270182992465,
274
- "grad_norm": NaN,
275
- "learning_rate": 3e-05,
276
- "loss": 0.0,
277
- "num_input_tokens_seen": 720128,
278
  "step": 270,
279
- "train_runtime": 633.5076,
280
- "train_tokens_per_second": 1136.731
281
  },
282
  {
283
  "epoch": 0.6027987082884823,
284
- "grad_norm": NaN,
285
- "learning_rate": 3e-05,
286
- "loss": 0.0,
287
- "num_input_tokens_seen": 747360,
288
  "step": 280,
289
- "train_runtime": 655.28,
290
- "train_tokens_per_second": 1140.52
291
  },
292
  {
293
  "epoch": 0.6243272335844995,
294
- "grad_norm": NaN,
295
- "learning_rate": 3e-05,
296
- "loss": 0.0,
297
- "num_input_tokens_seen": 774752,
298
  "step": 290,
299
- "train_runtime": 676.9385,
300
- "train_tokens_per_second": 1144.494
301
  },
302
  {
303
  "epoch": 0.6458557588805167,
304
- "grad_norm": NaN,
305
- "learning_rate": 3e-05,
306
- "loss": 0.0,
307
- "num_input_tokens_seen": 801216,
308
  "step": 300,
309
- "train_runtime": 698.3174,
310
- "train_tokens_per_second": 1147.352
311
  },
312
  {
313
  "epoch": 0.667384284176534,
314
- "grad_norm": NaN,
315
- "learning_rate": 3e-05,
316
- "loss": 0.0,
317
- "num_input_tokens_seen": 827552,
318
  "step": 310,
319
- "train_runtime": 719.7081,
320
- "train_tokens_per_second": 1149.844
321
  },
322
  {
323
  "epoch": 0.6889128094725512,
324
- "grad_norm": NaN,
325
- "learning_rate": 3e-05,
326
- "loss": 0.0,
327
- "num_input_tokens_seen": 854304,
328
  "step": 320,
329
- "train_runtime": 741.3129,
330
- "train_tokens_per_second": 1152.42
331
  },
332
  {
333
  "epoch": 0.7104413347685683,
334
- "grad_norm": NaN,
335
- "learning_rate": 3e-05,
336
- "loss": 0.0,
337
- "num_input_tokens_seen": 881344,
338
  "step": 330,
339
- "train_runtime": 762.9651,
340
- "train_tokens_per_second": 1155.156
341
  },
342
  {
343
  "epoch": 0.7319698600645855,
344
- "grad_norm": NaN,
345
- "learning_rate": 3e-05,
346
- "loss": 0.0,
347
- "num_input_tokens_seen": 907872,
348
  "step": 340,
349
- "train_runtime": 784.4227,
350
- "train_tokens_per_second": 1157.376
351
  },
352
  {
353
  "epoch": 0.7534983853606028,
354
- "grad_norm": NaN,
355
- "learning_rate": 3e-05,
356
- "loss": 0.0,
357
- "num_input_tokens_seen": 935968,
358
  "step": 350,
359
- "train_runtime": 806.8701,
360
- "train_tokens_per_second": 1159.998
361
  },
362
  {
363
  "epoch": 0.77502691065662,
364
- "grad_norm": NaN,
365
- "learning_rate": 3e-05,
366
- "loss": 0.0,
367
- "num_input_tokens_seen": 962816,
368
  "step": 360,
369
- "train_runtime": 828.4786,
370
- "train_tokens_per_second": 1162.15
371
  },
372
  {
373
  "epoch": 0.7965554359526372,
374
- "grad_norm": NaN,
375
- "learning_rate": 3e-05,
376
- "loss": 0.0,
377
- "num_input_tokens_seen": 990848,
378
  "step": 370,
379
- "train_runtime": 850.6384,
380
- "train_tokens_per_second": 1164.829
381
  },
382
  {
383
  "epoch": 0.8180839612486545,
384
- "grad_norm": NaN,
385
- "learning_rate": 3e-05,
386
- "loss": 0.0,
387
- "num_input_tokens_seen": 1017632,
388
  "step": 380,
389
- "train_runtime": 872.1711,
390
- "train_tokens_per_second": 1166.78
391
  },
392
  {
393
  "epoch": 0.8396124865446717,
394
- "grad_norm": NaN,
395
- "learning_rate": 3e-05,
396
- "loss": 0.0,
397
- "num_input_tokens_seen": 1044000,
398
  "step": 390,
399
- "train_runtime": 893.5948,
400
- "train_tokens_per_second": 1168.315
401
  },
402
  {
403
  "epoch": 0.8611410118406889,
404
- "grad_norm": NaN,
405
- "learning_rate": 3e-05,
406
- "loss": 0.0,
407
- "num_input_tokens_seen": 1070240,
408
  "step": 400,
409
- "train_runtime": 914.9469,
410
- "train_tokens_per_second": 1169.729
411
  },
412
  {
413
  "epoch": 0.8826695371367062,
414
- "grad_norm": NaN,
415
- "learning_rate": 3e-05,
416
- "loss": 0.0,
417
- "num_input_tokens_seen": 1097056,
418
  "step": 410,
419
- "train_runtime": 936.5773,
420
- "train_tokens_per_second": 1171.346
421
  },
422
  {
423
  "epoch": 0.9041980624327234,
424
- "grad_norm": NaN,
425
- "learning_rate": 3e-05,
426
- "loss": 0.0,
427
- "num_input_tokens_seen": 1123744,
428
  "step": 420,
429
- "train_runtime": 958.1608,
430
- "train_tokens_per_second": 1172.814
431
  },
432
  {
433
  "epoch": 0.9257265877287406,
434
- "grad_norm": NaN,
435
- "learning_rate": 3e-05,
436
- "loss": 0.0,
437
- "num_input_tokens_seen": 1150432,
438
  "step": 430,
439
- "train_runtime": 979.8442,
440
- "train_tokens_per_second": 1174.097
441
  },
442
  {
443
  "epoch": 0.9472551130247578,
444
- "grad_norm": NaN,
445
- "learning_rate": 3e-05,
446
- "loss": 0.0,
447
- "num_input_tokens_seen": 1175840,
448
  "step": 440,
449
- "train_runtime": 1000.9839,
450
- "train_tokens_per_second": 1174.684
451
  },
452
  {
453
  "epoch": 0.9687836383207751,
454
- "grad_norm": NaN,
455
- "learning_rate": 3e-05,
456
- "loss": 0.0,
457
- "num_input_tokens_seen": 1202496,
458
  "step": 450,
459
- "train_runtime": 1022.4292,
460
- "train_tokens_per_second": 1176.117
461
  },
462
  {
463
  "epoch": 0.9903121636167922,
464
- "grad_norm": NaN,
465
- "learning_rate": 3e-05,
466
- "loss": 0.0,
467
- "num_input_tokens_seen": 1228896,
468
  "step": 460,
469
- "train_runtime": 1043.8998,
470
- "train_tokens_per_second": 1177.216
471
  },
472
  {
473
  "epoch": 1.0107642626480087,
474
- "grad_norm": NaN,
475
- "learning_rate": 3e-05,
476
- "loss": 0.0,
477
- "num_input_tokens_seen": 1254560,
478
  "step": 470,
479
- "train_runtime": 1064.5717,
480
- "train_tokens_per_second": 1178.465
481
  },
482
  {
483
  "epoch": 1.0322927879440258,
484
- "grad_norm": NaN,
485
- "learning_rate": 3e-05,
486
- "loss": 0.0,
487
- "num_input_tokens_seen": 1281024,
488
  "step": 480,
489
- "train_runtime": 1086.0046,
490
- "train_tokens_per_second": 1179.575
491
  },
492
  {
493
  "epoch": 1.0538213132400431,
494
- "grad_norm": NaN,
495
- "learning_rate": 3e-05,
496
- "loss": 0.0,
497
- "num_input_tokens_seen": 1308032,
498
  "step": 490,
499
- "train_runtime": 1108.0344,
500
- "train_tokens_per_second": 1180.498
501
  },
502
  {
503
  "epoch": 1.0753498385360603,
504
- "grad_norm": NaN,
505
- "learning_rate": 3e-05,
506
- "loss": 0.0,
507
- "num_input_tokens_seen": 1335328,
508
  "step": 500,
509
- "train_runtime": 1129.7981,
510
- "train_tokens_per_second": 1181.917
511
  },
512
  {
513
  "epoch": 1.0968783638320776,
514
- "grad_norm": NaN,
515
- "learning_rate": 3e-05,
516
- "loss": 0.0,
517
- "num_input_tokens_seen": 1361888,
518
  "step": 510,
519
- "train_runtime": 1151.3927,
520
- "train_tokens_per_second": 1182.818
521
  },
522
  {
523
  "epoch": 1.1184068891280947,
524
- "grad_norm": NaN,
525
- "learning_rate": 3e-05,
526
- "loss": 0.0,
527
- "num_input_tokens_seen": 1388768,
528
  "step": 520,
529
- "train_runtime": 1173.0032,
530
- "train_tokens_per_second": 1183.942
531
  },
532
  {
533
  "epoch": 1.1399354144241118,
534
- "grad_norm": NaN,
535
- "learning_rate": 3e-05,
536
- "loss": 0.0,
537
- "num_input_tokens_seen": 1414912,
538
  "step": 530,
539
- "train_runtime": 1194.4547,
540
- "train_tokens_per_second": 1184.567
541
  },
542
  {
543
  "epoch": 1.1614639397201292,
544
- "grad_norm": NaN,
545
- "learning_rate": 3e-05,
546
- "loss": 0.0,
547
- "num_input_tokens_seen": 1441440,
548
  "step": 540,
549
- "train_runtime": 1215.9057,
550
- "train_tokens_per_second": 1185.487
551
  },
552
  {
553
  "epoch": 1.1829924650161463,
554
- "grad_norm": NaN,
555
- "learning_rate": 3e-05,
556
- "loss": 0.0,
557
- "num_input_tokens_seen": 1468864,
558
  "step": 550,
559
- "train_runtime": 1237.9092,
560
- "train_tokens_per_second": 1186.568
561
  },
562
  {
563
  "epoch": 1.2045209903121636,
564
- "grad_norm": NaN,
565
- "learning_rate": 3e-05,
566
- "loss": 0.0,
567
- "num_input_tokens_seen": 1495616,
568
  "step": 560,
569
- "train_runtime": 1259.4077,
570
- "train_tokens_per_second": 1187.555
571
  },
572
  {
573
  "epoch": 1.2260495156081808,
574
- "grad_norm": NaN,
575
- "learning_rate": 3e-05,
576
- "loss": 0.0,
577
- "num_input_tokens_seen": 1521856,
578
  "step": 570,
579
- "train_runtime": 1280.8048,
580
- "train_tokens_per_second": 1188.203
581
  },
582
  {
583
  "epoch": 1.247578040904198,
584
- "grad_norm": NaN,
585
- "learning_rate": 3e-05,
586
- "loss": 0.0,
587
- "num_input_tokens_seen": 1548640,
588
  "step": 580,
589
- "train_runtime": 1302.2946,
590
- "train_tokens_per_second": 1189.163
591
  },
592
  {
593
  "epoch": 1.2691065662002152,
594
- "grad_norm": NaN,
595
- "learning_rate": 3e-05,
596
- "loss": 0.0,
597
- "num_input_tokens_seen": 1575040,
598
  "step": 590,
599
- "train_runtime": 1323.6781,
600
- "train_tokens_per_second": 1189.897
601
  },
602
  {
603
  "epoch": 1.2906350914962326,
604
- "grad_norm": NaN,
605
- "learning_rate": 3e-05,
606
- "loss": 0.0,
607
- "num_input_tokens_seen": 1601280,
608
  "step": 600,
609
- "train_runtime": 1345.6098,
610
- "train_tokens_per_second": 1190.003
611
  },
612
  {
613
  "epoch": 1.3121636167922497,
614
- "grad_norm": NaN,
615
- "learning_rate": 3e-05,
616
- "loss": 0.0,
617
- "num_input_tokens_seen": 1628416,
618
  "step": 610,
619
- "train_runtime": 1367.3052,
620
- "train_tokens_per_second": 1190.967
621
  },
622
  {
623
  "epoch": 1.333692142088267,
624
- "grad_norm": NaN,
625
- "learning_rate": 3e-05,
626
- "loss": 0.0,
627
- "num_input_tokens_seen": 1654400,
628
  "step": 620,
629
- "train_runtime": 1388.5516,
630
- "train_tokens_per_second": 1191.457
631
  },
632
  {
633
  "epoch": 1.3552206673842842,
634
- "grad_norm": NaN,
635
- "learning_rate": 3e-05,
636
- "loss": 0.0,
637
- "num_input_tokens_seen": 1681632,
638
  "step": 630,
639
- "train_runtime": 1410.3043,
640
- "train_tokens_per_second": 1192.389
641
  },
642
  {
643
  "epoch": 1.3767491926803013,
644
- "grad_norm": NaN,
645
- "learning_rate": 3e-05,
646
- "loss": 0.0,
647
- "num_input_tokens_seen": 1708480,
648
  "step": 640,
649
- "train_runtime": 1431.8604,
650
- "train_tokens_per_second": 1193.189
651
  },
652
  {
653
  "epoch": 1.3982777179763186,
654
- "grad_norm": NaN,
655
- "learning_rate": 3e-05,
656
- "loss": 0.0,
657
- "num_input_tokens_seen": 1734816,
658
  "step": 650,
659
- "train_runtime": 1453.3567,
660
- "train_tokens_per_second": 1193.662
661
  },
662
  {
663
  "epoch": 1.419806243272336,
664
- "grad_norm": NaN,
665
- "learning_rate": 3e-05,
666
- "loss": 0.0,
667
- "num_input_tokens_seen": 1761248,
668
  "step": 660,
669
- "train_runtime": 1474.9227,
670
- "train_tokens_per_second": 1194.129
671
  },
672
  {
673
  "epoch": 1.441334768568353,
674
- "grad_norm": NaN,
675
- "learning_rate": 3e-05,
676
- "loss": 0.0,
677
- "num_input_tokens_seen": 1788064,
678
  "step": 670,
679
- "train_runtime": 1496.4738,
680
- "train_tokens_per_second": 1194.852
681
  },
682
  {
683
  "epoch": 1.4628632938643702,
684
- "grad_norm": NaN,
685
- "learning_rate": 3e-05,
686
- "loss": 0.0,
687
- "num_input_tokens_seen": 1815360,
688
  "step": 680,
689
- "train_runtime": 1518.1973,
690
- "train_tokens_per_second": 1195.734
691
  },
692
  {
693
  "epoch": 1.4843918191603875,
694
- "grad_norm": NaN,
695
- "learning_rate": 3e-05,
696
- "loss": 0.0,
697
- "num_input_tokens_seen": 1842112,
698
  "step": 690,
699
- "train_runtime": 1539.7277,
700
- "train_tokens_per_second": 1196.388
701
  },
702
  {
703
  "epoch": 1.5059203444564049,
704
- "grad_norm": NaN,
705
- "learning_rate": 3e-05,
706
- "loss": 0.0,
707
- "num_input_tokens_seen": 1868576,
708
  "step": 700,
709
- "train_runtime": 1561.4391,
710
- "train_tokens_per_second": 1196.701
711
  },
712
  {
713
  "epoch": 1.527448869752422,
714
- "grad_norm": NaN,
715
- "learning_rate": 3e-05,
716
- "loss": 0.0,
717
- "num_input_tokens_seen": 1895360,
718
  "step": 710,
719
- "train_runtime": 1583.0746,
720
- "train_tokens_per_second": 1197.265
721
  },
722
  {
723
  "epoch": 1.5489773950484391,
724
- "grad_norm": NaN,
725
- "learning_rate": 3e-05,
726
- "loss": 0.0,
727
- "num_input_tokens_seen": 1922272,
728
  "step": 720,
729
- "train_runtime": 1604.6761,
730
- "train_tokens_per_second": 1197.919
731
  },
732
  {
733
  "epoch": 1.5705059203444565,
734
- "grad_norm": NaN,
735
- "learning_rate": 3e-05,
736
- "loss": 0.0,
737
- "num_input_tokens_seen": 1947936,
738
  "step": 730,
739
- "train_runtime": 1625.9061,
740
- "train_tokens_per_second": 1198.062
741
  },
742
  {
743
  "epoch": 1.5920344456404736,
744
- "grad_norm": NaN,
745
- "learning_rate": 3e-05,
746
- "loss": 0.0,
747
- "num_input_tokens_seen": 1974528,
748
  "step": 740,
749
- "train_runtime": 1647.4063,
750
- "train_tokens_per_second": 1198.568
751
  },
752
  {
753
  "epoch": 1.6135629709364907,
754
- "grad_norm": NaN,
755
- "learning_rate": 3e-05,
756
- "loss": 0.0,
757
- "num_input_tokens_seen": 2001376,
758
  "step": 750,
759
- "train_runtime": 1669.1387,
760
- "train_tokens_per_second": 1199.047
761
  },
762
  {
763
  "epoch": 1.635091496232508,
764
- "grad_norm": NaN,
765
- "learning_rate": 3e-05,
766
- "loss": 0.0,
767
- "num_input_tokens_seen": 2027552,
768
  "step": 760,
769
- "train_runtime": 1690.5608,
770
- "train_tokens_per_second": 1199.337
771
  },
772
  {
773
  "epoch": 1.6566200215285254,
774
- "grad_norm": NaN,
775
- "learning_rate": 3e-05,
776
- "loss": 0.0,
777
- "num_input_tokens_seen": 2054592,
778
  "step": 770,
779
- "train_runtime": 1712.235,
780
- "train_tokens_per_second": 1199.947
781
  },
782
  {
783
  "epoch": 1.6781485468245425,
784
- "grad_norm": NaN,
785
- "learning_rate": 3e-05,
786
- "loss": 0.0,
787
- "num_input_tokens_seen": 2082080,
788
  "step": 780,
789
- "train_runtime": 1734.0681,
790
- "train_tokens_per_second": 1200.691
791
  },
792
  {
793
  "epoch": 1.6996770721205596,
794
- "grad_norm": NaN,
795
- "learning_rate": 3e-05,
796
- "loss": 0.0,
797
- "num_input_tokens_seen": 2107424,
798
  "step": 790,
799
- "train_runtime": 1755.0443,
800
- "train_tokens_per_second": 1200.781
801
  },
802
  {
803
  "epoch": 1.721205597416577,
804
- "grad_norm": NaN,
805
- "learning_rate": 3e-05,
806
- "loss": 0.0,
807
- "num_input_tokens_seen": 2134176,
808
  "step": 800,
809
- "train_runtime": 1776.5164,
810
- "train_tokens_per_second": 1201.326
811
  },
812
  {
813
  "epoch": 1.7427341227125943,
814
- "grad_norm": NaN,
815
- "learning_rate": 3e-05,
816
- "loss": 0.0,
817
- "num_input_tokens_seen": 2161056,
818
  "step": 810,
819
- "train_runtime": 1798.1568,
820
- "train_tokens_per_second": 1201.817
821
  },
822
  {
823
  "epoch": 1.7642626480086114,
824
- "grad_norm": NaN,
825
- "learning_rate": 3e-05,
826
- "loss": 0.0,
827
- "num_input_tokens_seen": 2188064,
828
  "step": 820,
829
- "train_runtime": 1819.7877,
830
- "train_tokens_per_second": 1202.373
831
  },
832
  {
833
  "epoch": 1.7857911733046286,
834
- "grad_norm": NaN,
835
- "learning_rate": 3e-05,
836
- "loss": 0.0,
837
- "num_input_tokens_seen": 2214816,
838
  "step": 830,
839
- "train_runtime": 1841.4354,
840
- "train_tokens_per_second": 1202.766
841
  },
842
  {
843
  "epoch": 1.807319698600646,
844
- "grad_norm": NaN,
845
- "learning_rate": 3e-05,
846
- "loss": 0.0,
847
- "num_input_tokens_seen": 2241984,
848
  "step": 840,
849
- "train_runtime": 1863.1657,
850
- "train_tokens_per_second": 1203.32
851
  },
852
  {
853
  "epoch": 1.8288482238966632,
854
- "grad_norm": NaN,
855
- "learning_rate": 3e-05,
856
- "loss": 0.0,
857
- "num_input_tokens_seen": 2268480,
858
  "step": 850,
859
- "train_runtime": 1884.6464,
860
- "train_tokens_per_second": 1203.663
861
  },
862
  {
863
  "epoch": 1.8503767491926801,
864
- "grad_norm": NaN,
865
- "learning_rate": 3e-05,
866
- "loss": 0.0,
867
- "num_input_tokens_seen": 2295648,
868
  "step": 860,
869
- "train_runtime": 1906.4991,
870
- "train_tokens_per_second": 1204.117
871
  },
872
  {
873
  "epoch": 1.8719052744886975,
874
- "grad_norm": NaN,
875
- "learning_rate": 3e-05,
876
- "loss": 0.0,
877
- "num_input_tokens_seen": 2322752,
878
  "step": 870,
879
- "train_runtime": 1928.2464,
880
- "train_tokens_per_second": 1204.593
881
  },
882
  {
883
  "epoch": 1.8934337997847148,
884
- "grad_norm": NaN,
885
- "learning_rate": 3e-05,
886
- "loss": 0.0,
887
- "num_input_tokens_seen": 2349440,
888
  "step": 880,
889
- "train_runtime": 1949.8363,
890
- "train_tokens_per_second": 1204.942
891
  },
892
  {
893
  "epoch": 1.914962325080732,
894
- "grad_norm": NaN,
895
- "learning_rate": 3e-05,
896
- "loss": 0.0,
897
- "num_input_tokens_seen": 2375744,
898
  "step": 890,
899
- "train_runtime": 1971.2562,
900
- "train_tokens_per_second": 1205.193
901
  },
902
  {
903
  "epoch": 1.936490850376749,
904
- "grad_norm": NaN,
905
- "learning_rate": 3e-05,
906
- "loss": 0.0,
907
- "num_input_tokens_seen": 2401952,
908
  "step": 900,
909
- "train_runtime": 1992.6749,
910
- "train_tokens_per_second": 1205.391
911
  },
912
  {
913
  "epoch": 1.9580193756727664,
914
- "grad_norm": NaN,
915
- "learning_rate": 3e-05,
916
- "loss": 0.0,
917
- "num_input_tokens_seen": 2428384,
918
  "step": 910,
919
- "train_runtime": 2014.3916,
920
- "train_tokens_per_second": 1205.517
921
  },
922
  {
923
  "epoch": 1.9795479009687837,
924
- "grad_norm": NaN,
925
- "learning_rate": 3e-05,
926
- "loss": 0.0,
927
- "num_input_tokens_seen": 2455040,
928
  "step": 920,
929
- "train_runtime": 2036.2422,
930
- "train_tokens_per_second": 1205.672
931
  },
932
  {
933
  "epoch": 2.0,
934
- "grad_norm": NaN,
935
- "learning_rate": 3e-05,
936
- "loss": 0.0,
937
- "num_input_tokens_seen": 2480832,
938
  "step": 930,
939
- "train_runtime": 2057.1,
940
- "train_tokens_per_second": 1205.985
941
  },
942
  {
943
  "epoch": 2.0215285252960173,
944
- "grad_norm": NaN,
945
- "learning_rate": 3e-05,
946
- "loss": 0.0,
947
- "num_input_tokens_seen": 2507296,
948
  "step": 940,
949
- "train_runtime": 2078.6644,
950
- "train_tokens_per_second": 1206.205
951
  },
952
  {
953
  "epoch": 2.0430570505920342,
954
- "grad_norm": NaN,
955
- "learning_rate": 3e-05,
956
- "loss": 0.0,
957
- "num_input_tokens_seen": 2534048,
958
  "step": 950,
959
- "train_runtime": 2100.3618,
960
- "train_tokens_per_second": 1206.482
961
  },
962
  {
963
  "epoch": 2.0645855758880516,
964
- "grad_norm": NaN,
965
- "learning_rate": 3e-05,
966
- "loss": 0.0,
967
- "num_input_tokens_seen": 2560672,
968
  "step": 960,
969
- "train_runtime": 2121.8682,
970
- "train_tokens_per_second": 1206.801
971
  },
972
  {
973
  "epoch": 2.086114101184069,
974
- "grad_norm": NaN,
975
- "learning_rate": 3e-05,
976
- "loss": 0.0,
977
- "num_input_tokens_seen": 2587520,
978
  "step": 970,
979
- "train_runtime": 2143.5225,
980
- "train_tokens_per_second": 1207.135
981
  },
982
  {
983
  "epoch": 2.1076426264800863,
984
- "grad_norm": NaN,
985
- "learning_rate": 3e-05,
986
- "loss": 0.0,
987
- "num_input_tokens_seen": 2614624,
988
  "step": 980,
989
- "train_runtime": 2165.3081,
990
- "train_tokens_per_second": 1207.507
991
  },
992
  {
993
  "epoch": 2.129171151776103,
994
- "grad_norm": NaN,
995
- "learning_rate": 3e-05,
996
- "loss": 0.0,
997
- "num_input_tokens_seen": 2641056,
998
  "step": 990,
999
- "train_runtime": 2186.8029,
1000
- "train_tokens_per_second": 1207.725
1001
  },
1002
  {
1003
  "epoch": 2.1506996770721205,
1004
- "grad_norm": NaN,
1005
- "learning_rate": 3e-05,
1006
- "loss": 0.0,
1007
- "num_input_tokens_seen": 2668128,
1008
  "step": 1000,
1009
- "train_runtime": 2208.4802,
1010
- "train_tokens_per_second": 1208.129
1011
  },
1012
  {
1013
  "epoch": 2.172228202368138,
1014
- "grad_norm": NaN,
1015
- "learning_rate": 3e-05,
1016
- "loss": 0.0,
1017
- "num_input_tokens_seen": 2695040,
1018
  "step": 1010,
1019
- "train_runtime": 2236.0516,
1020
- "train_tokens_per_second": 1205.267
1021
  },
1022
  {
1023
  "epoch": 2.193756727664155,
1024
- "grad_norm": NaN,
1025
- "learning_rate": 3e-05,
1026
- "loss": 0.0,
1027
- "num_input_tokens_seen": 2722176,
1028
  "step": 1020,
1029
- "train_runtime": 2257.7909,
1030
- "train_tokens_per_second": 1205.681
1031
  },
1032
  {
1033
  "epoch": 2.215285252960172,
1034
- "grad_norm": NaN,
1035
- "learning_rate": 3e-05,
1036
- "loss": 0.0,
1037
- "num_input_tokens_seen": 2749120,
1038
  "step": 1030,
1039
- "train_runtime": 2279.4947,
1040
- "train_tokens_per_second": 1206.022
1041
  },
1042
  {
1043
  "epoch": 2.2368137782561894,
1044
- "grad_norm": NaN,
1045
- "learning_rate": 3e-05,
1046
- "loss": 0.0,
1047
- "num_input_tokens_seen": 2776320,
1048
  "step": 1040,
1049
- "train_runtime": 2301.3681,
1050
- "train_tokens_per_second": 1206.378
1051
  },
1052
  {
1053
  "epoch": 2.2583423035522068,
1054
- "grad_norm": NaN,
1055
- "learning_rate": 3e-05,
1056
- "loss": 0.0,
1057
- "num_input_tokens_seen": 2802848,
1058
  "step": 1050,
1059
- "train_runtime": 2322.9409,
1060
- "train_tokens_per_second": 1206.595
1061
  },
1062
  {
1063
  "epoch": 2.2798708288482237,
1064
- "grad_norm": NaN,
1065
- "learning_rate": 3e-05,
1066
- "loss": 0.0,
1067
- "num_input_tokens_seen": 2829216,
1068
  "step": 1060,
1069
- "train_runtime": 2344.4991,
1070
- "train_tokens_per_second": 1206.746
1071
  },
1072
  {
1073
  "epoch": 2.301399354144241,
1074
- "grad_norm": NaN,
1075
- "learning_rate": 3e-05,
1076
- "loss": 0.0,
1077
- "num_input_tokens_seen": 2855456,
1078
  "step": 1070,
1079
- "train_runtime": 2365.869,
1080
- "train_tokens_per_second": 1206.938
1081
  },
1082
  {
1083
  "epoch": 2.3229278794402584,
1084
- "grad_norm": NaN,
1085
- "learning_rate": 3e-05,
1086
- "loss": 0.0,
1087
- "num_input_tokens_seen": 2881760,
1088
  "step": 1080,
1089
- "train_runtime": 2387.3046,
1090
- "train_tokens_per_second": 1207.119
1091
  },
1092
  {
1093
  "epoch": 2.3444564047362757,
1094
- "grad_norm": NaN,
1095
- "learning_rate": 3e-05,
1096
- "loss": 0.0,
1097
- "num_input_tokens_seen": 2909440,
1098
  "step": 1090,
1099
- "train_runtime": 2409.3177,
1100
- "train_tokens_per_second": 1207.578
1101
  },
1102
  {
1103
  "epoch": 2.3659849300322926,
1104
- "grad_norm": NaN,
1105
- "learning_rate": 3e-05,
1106
- "loss": 0.0,
1107
- "num_input_tokens_seen": 2935712,
1108
  "step": 1100,
1109
- "train_runtime": 2430.7541,
1110
- "train_tokens_per_second": 1207.737
1111
  },
1112
  {
1113
  "epoch": 2.38751345532831,
1114
- "grad_norm": NaN,
1115
- "learning_rate": 3e-05,
1116
- "loss": 0.0,
1117
- "num_input_tokens_seen": 2962880,
1118
  "step": 1110,
1119
- "train_runtime": 2452.4619,
1120
- "train_tokens_per_second": 1208.125
1121
  },
1122
  {
1123
  "epoch": 2.4090419806243273,
1124
- "grad_norm": NaN,
1125
- "learning_rate": 3e-05,
1126
- "loss": 0.0,
1127
- "num_input_tokens_seen": 2990080,
1128
  "step": 1120,
1129
- "train_runtime": 2474.4861,
1130
- "train_tokens_per_second": 1208.364
1131
  },
1132
  {
1133
  "epoch": 2.4305705059203446,
1134
- "grad_norm": NaN,
1135
- "learning_rate": 3e-05,
1136
- "loss": 0.0,
1137
- "num_input_tokens_seen": 3016736,
1138
  "step": 1130,
1139
- "train_runtime": 2496.0824,
1140
- "train_tokens_per_second": 1208.588
1141
  },
1142
  {
1143
  "epoch": 2.4520990312163615,
1144
- "grad_norm": NaN,
1145
- "learning_rate": 3e-05,
1146
- "loss": 0.0,
1147
- "num_input_tokens_seen": 3043264,
1148
  "step": 1140,
1149
- "train_runtime": 2517.5928,
1150
- "train_tokens_per_second": 1208.799
1151
  },
1152
  {
1153
  "epoch": 2.473627556512379,
1154
- "grad_norm": NaN,
1155
- "learning_rate": 3e-05,
1156
- "loss": 0.0,
1157
- "num_input_tokens_seen": 3070304,
1158
  "step": 1150,
1159
- "train_runtime": 2539.2269,
1160
- "train_tokens_per_second": 1209.149
1161
  },
1162
  {
1163
  "epoch": 2.495156081808396,
1164
- "grad_norm": NaN,
1165
- "learning_rate": 3e-05,
1166
- "loss": 0.0,
1167
- "num_input_tokens_seen": 3096672,
1168
  "step": 1160,
1169
- "train_runtime": 2560.7665,
1170
- "train_tokens_per_second": 1209.275
1171
  },
1172
  {
1173
  "epoch": 2.5166846071044136,
1174
- "grad_norm": NaN,
1175
- "learning_rate": 3e-05,
1176
- "loss": 0.0,
1177
- "num_input_tokens_seen": 3123232,
1178
  "step": 1170,
1179
- "train_runtime": 2582.3993,
1180
- "train_tokens_per_second": 1209.43
1181
  },
1182
  {
1183
  "epoch": 2.5382131324004304,
1184
- "grad_norm": NaN,
1185
- "learning_rate": 3e-05,
1186
- "loss": 0.0,
1187
- "num_input_tokens_seen": 3149792,
1188
  "step": 1180,
1189
- "train_runtime": 2603.8176,
1190
- "train_tokens_per_second": 1209.682
1191
  },
1192
  {
1193
  "epoch": 2.559741657696448,
1194
- "grad_norm": NaN,
1195
- "learning_rate": 3e-05,
1196
- "loss": 0.0,
1197
- "num_input_tokens_seen": 3177152,
1198
  "step": 1190,
1199
- "train_runtime": 2625.6164,
1200
- "train_tokens_per_second": 1210.059
1201
  },
1202
  {
1203
  "epoch": 2.581270182992465,
1204
- "grad_norm": NaN,
1205
- "learning_rate": 3e-05,
1206
- "loss": 0.0,
1207
- "num_input_tokens_seen": 3203840,
1208
  "step": 1200,
1209
- "train_runtime": 2647.2692,
1210
- "train_tokens_per_second": 1210.243
1211
  },
1212
  {
1213
  "epoch": 2.602798708288482,
1214
- "grad_norm": NaN,
1215
- "learning_rate": 3e-05,
1216
- "loss": 0.0,
1217
- "num_input_tokens_seen": 3230720,
1218
  "step": 1210,
1219
- "train_runtime": 2668.9701,
1220
- "train_tokens_per_second": 1210.474
1221
  },
1222
  {
1223
  "epoch": 2.6243272335844994,
1224
- "grad_norm": NaN,
1225
- "learning_rate": 3e-05,
1226
- "loss": 0.0,
1227
- "num_input_tokens_seen": 3256544,
1228
  "step": 1220,
1229
- "train_runtime": 2690.1588,
1230
- "train_tokens_per_second": 1210.54
1231
  },
1232
  {
1233
  "epoch": 2.6458557588805167,
1234
- "grad_norm": NaN,
1235
- "learning_rate": 3e-05,
1236
- "loss": 0.0,
1237
- "num_input_tokens_seen": 3283136,
1238
  "step": 1230,
1239
- "train_runtime": 2711.6377,
1240
- "train_tokens_per_second": 1210.758
1241
  },
1242
  {
1243
  "epoch": 2.667384284176534,
1244
- "grad_norm": NaN,
1245
- "learning_rate": 3e-05,
1246
- "loss": 0.0,
1247
- "num_input_tokens_seen": 3310464,
1248
  "step": 1240,
1249
- "train_runtime": 2733.5223,
1250
- "train_tokens_per_second": 1211.062
1251
  },
1252
  {
1253
  "epoch": 2.6889128094725514,
1254
- "grad_norm": NaN,
1255
- "learning_rate": 3e-05,
1256
- "loss": 0.0,
1257
- "num_input_tokens_seen": 3336608,
1258
  "step": 1250,
1259
- "train_runtime": 2754.8994,
1260
- "train_tokens_per_second": 1211.154
1261
  },
1262
  {
1263
  "epoch": 2.7104413347685683,
1264
- "grad_norm": NaN,
1265
- "learning_rate": 3e-05,
1266
- "loss": 0.0,
1267
- "num_input_tokens_seen": 3363200,
1268
  "step": 1260,
1269
- "train_runtime": 2776.4685,
1270
- "train_tokens_per_second": 1211.323
1271
  },
1272
  {
1273
  "epoch": 2.7319698600645856,
1274
- "grad_norm": NaN,
1275
- "learning_rate": 3e-05,
1276
- "loss": 0.0,
1277
- "num_input_tokens_seen": 3390176,
1278
  "step": 1270,
1279
- "train_runtime": 2798.1585,
1280
- "train_tokens_per_second": 1211.574
1281
  },
1282
  {
1283
  "epoch": 2.7534983853606025,
1284
- "grad_norm": NaN,
1285
- "learning_rate": 3e-05,
1286
- "loss": 0.0,
1287
- "num_input_tokens_seen": 3416832,
1288
  "step": 1280,
1289
- "train_runtime": 2819.8163,
1290
- "train_tokens_per_second": 1211.721
1291
  },
1292
  {
1293
  "epoch": 2.77502691065662,
1294
- "grad_norm": NaN,
1295
- "learning_rate": 3e-05,
1296
- "loss": 0.0,
1297
- "num_input_tokens_seen": 3443264,
1298
  "step": 1290,
1299
- "train_runtime": 2841.1743,
1300
- "train_tokens_per_second": 1211.916
1301
  },
1302
  {
1303
  "epoch": 2.7965554359526372,
1304
- "grad_norm": NaN,
1305
- "learning_rate": 3e-05,
1306
- "loss": 0.0,
1307
- "num_input_tokens_seen": 3470400,
1308
  "step": 1300,
1309
- "train_runtime": 2862.8952,
1310
- "train_tokens_per_second": 1212.199
1311
  },
1312
  {
1313
  "epoch": 2.8180839612486546,
1314
- "grad_norm": NaN,
1315
- "learning_rate": 3e-05,
1316
- "loss": 0.0,
1317
- "num_input_tokens_seen": 3497440,
1318
  "step": 1310,
1319
- "train_runtime": 2884.5689,
1320
- "train_tokens_per_second": 1212.465
1321
  },
1322
  {
1323
  "epoch": 2.839612486544672,
1324
- "grad_norm": NaN,
1325
- "learning_rate": 3e-05,
1326
- "loss": 0.0,
1327
- "num_input_tokens_seen": 3523968,
1328
  "step": 1320,
1329
- "train_runtime": 2906.0583,
1330
- "train_tokens_per_second": 1212.628
1331
  },
1332
  {
1333
  "epoch": 2.861141011840689,
1334
- "grad_norm": NaN,
1335
- "learning_rate": 3e-05,
1336
- "loss": 0.0,
1337
- "num_input_tokens_seen": 3550816,
1338
  "step": 1330,
1339
- "train_runtime": 2927.5598,
1340
- "train_tokens_per_second": 1212.893
1341
  },
1342
  {
1343
  "epoch": 2.882669537136706,
1344
- "grad_norm": NaN,
1345
- "learning_rate": 3e-05,
1346
- "loss": 0.0,
1347
- "num_input_tokens_seen": 3577248,
1348
  "step": 1340,
1349
- "train_runtime": 2949.1563,
1350
- "train_tokens_per_second": 1212.973
1351
  },
1352
  {
1353
  "epoch": 2.9041980624327235,
1354
- "grad_norm": NaN,
1355
- "learning_rate": 3e-05,
1356
- "loss": 0.0,
1357
- "num_input_tokens_seen": 3603488,
1358
  "step": 1350,
1359
- "train_runtime": 2970.6067,
1360
- "train_tokens_per_second": 1213.048
1361
  },
1362
  {
1363
  "epoch": 2.9257265877287404,
1364
- "grad_norm": NaN,
1365
- "learning_rate": 3e-05,
1366
- "loss": 0.0,
1367
- "num_input_tokens_seen": 3630336,
1368
  "step": 1360,
1369
- "train_runtime": 2992.2294,
1370
- "train_tokens_per_second": 1213.255
1371
  },
1372
  {
1373
  "epoch": 2.9472551130247577,
1374
- "grad_norm": NaN,
1375
- "learning_rate": 3e-05,
1376
- "loss": 0.0,
1377
- "num_input_tokens_seen": 3656832,
1378
  "step": 1370,
1379
- "train_runtime": 3013.8336,
1380
- "train_tokens_per_second": 1213.349
1381
  },
1382
  {
1383
  "epoch": 2.968783638320775,
1384
- "grad_norm": NaN,
1385
- "learning_rate": 3e-05,
1386
- "loss": 0.0,
1387
- "num_input_tokens_seen": 3683488,
1388
  "step": 1380,
1389
- "train_runtime": 3035.3965,
1390
- "train_tokens_per_second": 1213.511
1391
  },
1392
  {
1393
  "epoch": 2.9903121636167924,
1394
- "grad_norm": NaN,
1395
- "learning_rate": 3e-05,
1396
- "loss": 0.0,
1397
- "num_input_tokens_seen": 3710400,
1398
  "step": 1390,
1399
- "train_runtime": 3056.9784,
1400
- "train_tokens_per_second": 1213.748
1401
  },
1402
  {
1403
  "epoch": 3.0,
1404
- "num_input_tokens_seen": 3722368,
1405
  "step": 1395,
1406
- "total_flos": 2.5033214310893568e+17,
1407
- "train_loss": 0.0,
1408
- "train_runtime": 3072.4201,
1409
- "train_samples_per_second": 3.628,
1410
- "train_steps_per_second": 0.454
1411
  }
1412
  ],
1413
  "logging_steps": 10,
1414
  "max_steps": 1395,
1415
- "num_input_tokens_seen": 3722368,
1416
  "num_train_epochs": 3,
1417
  "save_steps": 1000,
1418
  "stateful_callbacks": {
@@ -1427,7 +1427,7 @@
1427
  "attributes": {}
1428
  }
1429
  },
1430
- "total_flos": 2.5033214310893568e+17,
1431
  "train_batch_size": 4,
1432
  "trial_name": null,
1433
  "trial_params": null
 
11
  "log_history": [
12
  {
13
  "epoch": 0.021528525296017224,
14
+ "grad_norm": 16.47992515563965,
15
+ "learning_rate": 9.998973021172564e-06,
16
+ "loss": 1.7834,
17
+ "num_input_tokens_seen": 43648,
18
  "step": 10,
19
+ "train_runtime": 64.3878,
20
+ "train_tokens_per_second": 677.892
21
  },
22
  {
23
  "epoch": 0.04305705059203445,
24
+ "grad_norm": 16.372161865234375,
25
+ "learning_rate": 9.995423512524277e-06,
26
+ "loss": 0.7676,
27
+ "num_input_tokens_seen": 87072,
28
  "step": 20,
29
+ "train_runtime": 95.1979,
30
+ "train_tokens_per_second": 914.642
31
  },
32
  {
33
  "epoch": 0.06458557588805167,
34
+ "grad_norm": 11.686817169189453,
35
+ "learning_rate": 9.98934059499448e-06,
36
+ "loss": 0.5817,
37
+ "num_input_tokens_seen": 131520,
38
  "step": 30,
39
+ "train_runtime": 126.5065,
40
+ "train_tokens_per_second": 1039.63
41
  },
42
  {
43
  "epoch": 0.0861141011840689,
44
+ "grad_norm": 3.2975926399230957,
45
+ "learning_rate": 9.980727353510257e-06,
46
+ "loss": 0.3531,
47
+ "num_input_tokens_seen": 175680,
48
  "step": 40,
49
+ "train_runtime": 157.6702,
50
+ "train_tokens_per_second": 1114.225
51
  },
52
  {
53
  "epoch": 0.10764262648008611,
54
+ "grad_norm": 3.4886627197265625,
55
+ "learning_rate": 9.969588156242282e-06,
56
+ "loss": 0.3352,
57
+ "num_input_tokens_seen": 219584,
58
  "step": 50,
59
+ "train_runtime": 188.7104,
60
+ "train_tokens_per_second": 1163.603
61
  },
62
  {
63
  "epoch": 0.12917115177610333,
64
+ "grad_norm": 3.484487295150757,
65
+ "learning_rate": 9.95592865238951e-06,
66
+ "loss": 0.2298,
67
+ "num_input_tokens_seen": 263392,
68
  "step": 60,
69
+ "train_runtime": 219.7077,
70
+ "train_tokens_per_second": 1198.829
71
  },
72
  {
73
  "epoch": 0.15069967707212056,
74
+ "grad_norm": 4.422971725463867,
75
+ "learning_rate": 9.939755769314215e-06,
76
+ "loss": 0.1981,
77
+ "num_input_tokens_seen": 306912,
78
  "step": 70,
79
+ "train_runtime": 250.6069,
80
+ "train_tokens_per_second": 1224.675
81
  },
82
  {
83
  "epoch": 0.1722282023681378,
84
+ "grad_norm": 1.4185198545455933,
85
+ "learning_rate": 9.9210777090288e-06,
86
+ "loss": 0.1755,
87
+ "num_input_tokens_seen": 349824,
88
  "step": 80,
89
+ "train_runtime": 281.2405,
90
+ "train_tokens_per_second": 1243.86
91
  },
92
  {
93
  "epoch": 0.193756727664155,
94
+ "grad_norm": 1.1935056447982788,
95
+ "learning_rate": 9.899903944036185e-06,
96
+ "loss": 0.1791,
97
+ "num_input_tokens_seen": 393664,
98
  "step": 90,
99
+ "train_runtime": 312.2075,
100
+ "train_tokens_per_second": 1260.905
101
  },
102
  {
103
  "epoch": 0.21528525296017223,
104
+ "grad_norm": 2.463397741317749,
105
+ "learning_rate": 9.87624521252587e-06,
106
+ "loss": 0.2051,
107
+ "num_input_tokens_seen": 437952,
108
  "step": 100,
109
+ "train_runtime": 343.3508,
110
+ "train_tokens_per_second": 1275.523
111
  },
112
  {
113
  "epoch": 0.23681377825618946,
114
+ "grad_norm": 3.8650355339050293,
115
+ "learning_rate": 9.850113512928094e-06,
116
+ "loss": 0.1912,
117
+ "num_input_tokens_seen": 481472,
118
  "step": 110,
119
+ "train_runtime": 374.2539,
120
+ "train_tokens_per_second": 1286.485
121
  },
122
  {
123
  "epoch": 0.25834230355220666,
124
+ "grad_norm": 4.704444885253906,
125
+ "learning_rate": 9.821522097828884e-06,
126
+ "loss": 0.1637,
127
+ "num_input_tokens_seen": 525472,
128
  "step": 120,
129
+ "train_runtime": 405.4374,
130
+ "train_tokens_per_second": 1296.062
131
  },
132
  {
133
  "epoch": 0.2798708288482239,
134
+ "grad_norm": 2.7267754077911377,
135
+ "learning_rate": 9.790485467249065e-06,
136
+ "loss": 0.1537,
137
+ "num_input_tokens_seen": 569696,
138
  "step": 130,
139
+ "train_runtime": 436.4834,
140
+ "train_tokens_per_second": 1305.195
141
  },
142
  {
143
  "epoch": 0.3013993541442411,
144
+ "grad_norm": 3.512826681137085,
145
+ "learning_rate": 9.757019361290621e-06,
146
+ "loss": 0.1846,
147
+ "num_input_tokens_seen": 613760,
148
  "step": 140,
149
+ "train_runtime": 467.5968,
150
+ "train_tokens_per_second": 1312.584
151
  },
152
  {
153
  "epoch": 0.32292787944025836,
154
+ "grad_norm": 2.484517812728882,
155
+ "learning_rate": 9.721140752154182e-06,
156
+ "loss": 0.1872,
157
+ "num_input_tokens_seen": 657824,
158
  "step": 150,
159
+ "train_runtime": 498.6389,
160
+ "train_tokens_per_second": 1319.239
161
  },
162
  {
163
  "epoch": 0.3444564047362756,
164
+ "grad_norm": 2.296607255935669,
165
+ "learning_rate": 9.682867835531624e-06,
166
+ "loss": 0.1372,
167
+ "num_input_tokens_seen": 701760,
168
  "step": 160,
169
+ "train_runtime": 529.7256,
170
+ "train_tokens_per_second": 1324.761
171
  },
172
  {
173
  "epoch": 0.36598493003229277,
174
+ "grad_norm": 3.887946128845215,
175
+ "learning_rate": 9.642220021378212e-06,
176
+ "loss": 0.2028,
177
+ "num_input_tokens_seen": 745184,
178
  "step": 170,
179
+ "train_runtime": 560.5239,
180
+ "train_tokens_per_second": 1329.442
181
  },
182
  {
183
  "epoch": 0.38751345532831,
184
+ "grad_norm": 2.1227307319641113,
185
+ "learning_rate": 9.59921792406891e-06,
186
+ "loss": 0.1765,
187
+ "num_input_tokens_seen": 789216,
188
  "step": 180,
189
+ "train_runtime": 591.5958,
190
+ "train_tokens_per_second": 1334.046
191
  },
192
  {
193
  "epoch": 0.40904198062432723,
194
+ "grad_norm": 3.007882595062256,
195
+ "learning_rate": 9.553883351943882e-06,
196
+ "loss": 0.1882,
197
+ "num_input_tokens_seen": 832960,
198
  "step": 190,
199
+ "train_runtime": 622.6094,
200
+ "train_tokens_per_second": 1337.853
201
  },
202
  {
203
  "epoch": 0.43057050592034446,
204
+ "grad_norm": 1.8637208938598633,
205
+ "learning_rate": 9.506239296248497e-06,
206
+ "loss": 0.1336,
207
+ "num_input_tokens_seen": 877664,
208
  "step": 200,
209
+ "train_runtime": 654.0867,
210
+ "train_tokens_per_second": 1341.816
211
  },
212
  {
213
  "epoch": 0.4520990312163617,
214
+ "grad_norm": 1.1324244737625122,
215
+ "learning_rate": 9.456309919473384e-06,
216
+ "loss": 0.1521,
217
+ "num_input_tokens_seen": 921536,
218
  "step": 210,
219
+ "train_runtime": 685.133,
220
+ "train_tokens_per_second": 1345.047
221
  },
222
  {
223
  "epoch": 0.4736275565123789,
224
+ "grad_norm": 3.536208391189575,
225
+ "learning_rate": 9.404120543100553e-06,
226
+ "loss": 0.1864,
227
+ "num_input_tokens_seen": 965344,
228
  "step": 220,
229
+ "train_runtime": 716.7323,
230
+ "train_tokens_per_second": 1346.868
231
  },
232
  {
233
  "epoch": 0.4951560818083961,
234
+ "grad_norm": 1.73074209690094,
235
+ "learning_rate": 9.34969763476168e-06,
236
+ "loss": 0.1625,
237
+ "num_input_tokens_seen": 1008672,
238
  "step": 230,
239
+ "train_runtime": 747.5266,
240
+ "train_tokens_per_second": 1349.346
241
  },
242
  {
243
  "epoch": 0.5166846071044133,
244
+ "grad_norm": 1.4830386638641357,
245
+ "learning_rate": 9.293068794815175e-06,
246
+ "loss": 0.1456,
247
+ "num_input_tokens_seen": 1051936,
248
  "step": 240,
249
+ "train_runtime": 778.3038,
250
+ "train_tokens_per_second": 1351.575
251
  },
252
  {
253
  "epoch": 0.5382131324004306,
254
+ "grad_norm": 2.7361512184143066,
255
+ "learning_rate": 9.234262742348764e-06,
256
+ "loss": 0.165,
257
+ "num_input_tokens_seen": 1095904,
258
  "step": 250,
259
+ "train_runtime": 809.3485,
260
+ "train_tokens_per_second": 1354.057
261
  },
262
  {
263
  "epoch": 0.5597416576964478,
264
+ "grad_norm": 1.9473741054534912,
265
+ "learning_rate": 9.17330930061471e-06,
266
+ "loss": 0.1487,
267
+ "num_input_tokens_seen": 1140064,
268
  "step": 260,
269
+ "train_runtime": 840.5464,
270
+ "train_tokens_per_second": 1356.337
271
  },
272
  {
273
  "epoch": 0.581270182992465,
274
+ "grad_norm": 2.0610098838806152,
275
+ "learning_rate": 9.11023938190509e-06,
276
+ "loss": 0.1687,
277
+ "num_input_tokens_seen": 1183872,
278
  "step": 270,
279
+ "train_runtime": 871.5774,
280
+ "train_tokens_per_second": 1358.31
281
  },
282
  {
283
  "epoch": 0.6027987082884823,
284
+ "grad_norm": 3.2189598083496094,
285
+ "learning_rate": 9.045084971874738e-06,
286
+ "loss": 0.1511,
287
+ "num_input_tokens_seen": 1228544,
288
  "step": 280,
289
+ "train_runtime": 903.1191,
290
+ "train_tokens_per_second": 1360.334
291
  },
292
  {
293
  "epoch": 0.6243272335844995,
294
+ "grad_norm": 3.902757406234741,
295
+ "learning_rate": 8.977879113319847e-06,
296
+ "loss": 0.184,
297
+ "num_input_tokens_seen": 1271968,
298
  "step": 290,
299
+ "train_runtime": 934.0522,
300
+ "train_tokens_per_second": 1361.774
301
  },
302
  {
303
  "epoch": 0.6458557588805167,
304
+ "grad_norm": 4.2983012199401855,
305
+ "learning_rate": 8.90865588942046e-06,
306
+ "loss": 0.1305,
307
+ "num_input_tokens_seen": 1316096,
308
  "step": 300,
309
+ "train_runtime": 965.1778,
310
+ "train_tokens_per_second": 1363.579
311
  },
312
  {
313
  "epoch": 0.667384284176534,
314
+ "grad_norm": 2.6156394481658936,
315
+ "learning_rate": 8.83745040645531e-06,
316
+ "loss": 0.1405,
317
+ "num_input_tokens_seen": 1360256,
318
  "step": 310,
319
+ "train_runtime": 996.4077,
320
+ "train_tokens_per_second": 1365.16
321
  },
322
  {
323
  "epoch": 0.6889128094725512,
324
+ "grad_norm": 1.3506444692611694,
325
+ "learning_rate": 8.764298775997823e-06,
326
+ "loss": 0.1651,
327
+ "num_input_tokens_seen": 1404064,
328
  "step": 320,
329
+ "train_runtime": 1027.5151,
330
+ "train_tokens_per_second": 1366.466
331
  },
332
  {
333
  "epoch": 0.7104413347685683,
334
+ "grad_norm": 1.5117799043655396,
335
+ "learning_rate": 8.68923809660227e-06,
336
+ "loss": 0.1519,
337
+ "num_input_tokens_seen": 1448256,
338
  "step": 330,
339
+ "train_runtime": 1058.74,
340
+ "train_tokens_per_second": 1367.905
341
  },
342
  {
343
  "epoch": 0.7319698600645855,
344
+ "grad_norm": 1.2659231424331665,
345
+ "learning_rate": 8.612306434989395e-06,
346
+ "loss": 0.1574,
347
+ "num_input_tokens_seen": 1492448,
348
  "step": 340,
349
+ "train_runtime": 1090.0052,
350
+ "train_tokens_per_second": 1369.212
351
  },
352
  {
353
  "epoch": 0.7534983853606028,
354
+ "grad_norm": 2.6010894775390625,
355
+ "learning_rate": 8.53354280674102e-06,
356
+ "loss": 0.1587,
357
+ "num_input_tokens_seen": 1537440,
358
  "step": 350,
359
+ "train_runtime": 1121.55,
360
+ "train_tokens_per_second": 1370.817
361
  },
362
  {
363
  "epoch": 0.77502691065662,
364
+ "grad_norm": 1.6968097686767578,
365
+ "learning_rate": 8.452987156513457e-06,
366
+ "loss": 0.1513,
367
+ "num_input_tokens_seen": 1581280,
368
  "step": 360,
369
+ "train_runtime": 1152.6858,
370
+ "train_tokens_per_second": 1371.822
371
  },
372
  {
373
  "epoch": 0.7965554359526372,
374
+ "grad_norm": 2.0298380851745605,
375
+ "learning_rate": 8.370680337779737e-06,
376
+ "loss": 0.1401,
377
+ "num_input_tokens_seen": 1625824,
378
  "step": 370,
379
+ "train_runtime": 1184.3507,
380
+ "train_tokens_per_second": 1372.756
381
  },
382
  {
383
  "epoch": 0.8180839612486545,
384
+ "grad_norm": 2.7614028453826904,
385
+ "learning_rate": 8.286664092110935e-06,
386
+ "loss": 0.1135,
387
+ "num_input_tokens_seen": 1669472,
388
  "step": 380,
389
+ "train_runtime": 1215.2935,
390
+ "train_tokens_per_second": 1373.719
391
  },
392
  {
393
  "epoch": 0.8396124865446717,
394
+ "grad_norm": 1.6297581195831299,
395
+ "learning_rate": 8.200981028007095e-06,
396
+ "loss": 0.1645,
397
+ "num_input_tokens_seen": 1713312,
398
  "step": 390,
399
+ "train_runtime": 1246.1254,
400
+ "train_tokens_per_second": 1374.911
401
  },
402
  {
403
  "epoch": 0.8611410118406889,
404
+ "grad_norm": 2.32612943649292,
405
+ "learning_rate": 8.11367459928851e-06,
406
+ "loss": 0.1129,
407
+ "num_input_tokens_seen": 1757056,
408
  "step": 400,
409
+ "train_runtime": 1277.0951,
410
+ "train_tokens_per_second": 1375.822
411
  },
412
  {
413
  "epoch": 0.8826695371367062,
414
+ "grad_norm": 1.5576270818710327,
415
+ "learning_rate": 8.024789083058289e-06,
416
+ "loss": 0.1333,
417
+ "num_input_tokens_seen": 1801632,
418
  "step": 410,
419
+ "train_runtime": 1308.5556,
420
+ "train_tokens_per_second": 1376.81
421
  },
422
  {
423
  "epoch": 0.9041980624327234,
424
+ "grad_norm": 8.420344352722168,
425
+ "learning_rate": 7.934369557247397e-06,
426
+ "loss": 0.1311,
427
+ "num_input_tokens_seen": 1845280,
428
  "step": 420,
429
+ "train_runtime": 1339.4668,
430
+ "train_tokens_per_second": 1377.623
431
  },
432
  {
433
  "epoch": 0.9257265877287406,
434
+ "grad_norm": 1.7291479110717773,
435
+ "learning_rate": 7.842461877753575e-06,
436
+ "loss": 0.1395,
437
+ "num_input_tokens_seen": 1889472,
438
  "step": 430,
439
+ "train_runtime": 1370.6369,
440
+ "train_tokens_per_second": 1378.536
441
  },
442
  {
443
  "epoch": 0.9472551130247578,
444
+ "grad_norm": 2.441693067550659,
445
+ "learning_rate": 7.7491126551857e-06,
446
+ "loss": 0.1175,
447
+ "num_input_tokens_seen": 1932832,
448
  "step": 440,
449
+ "train_runtime": 1401.3047,
450
+ "train_tokens_per_second": 1379.309
451
  },
452
  {
453
  "epoch": 0.9687836383207751,
454
+ "grad_norm": 1.3606727123260498,
455
+ "learning_rate": 7.654369231225398e-06,
456
+ "loss": 0.1154,
457
+ "num_input_tokens_seen": 1976000,
458
  "step": 450,
459
+ "train_runtime": 1431.9402,
460
+ "train_tokens_per_second": 1379.946
461
  },
462
  {
463
  "epoch": 0.9903121636167922,
464
+ "grad_norm": 2.911600351333618,
465
+ "learning_rate": 7.5582796546179125e-06,
466
+ "loss": 0.1408,
467
+ "num_input_tokens_seen": 2019968,
468
  "step": 460,
469
+ "train_runtime": 1463.035,
470
+ "train_tokens_per_second": 1380.67
471
  },
472
  {
473
  "epoch": 1.0107642626480087,
474
+ "grad_norm": 2.967047929763794,
475
+ "learning_rate": 7.460892656804366e-06,
476
+ "loss": 0.1126,
477
+ "num_input_tokens_seen": 2061440,
478
  "step": 470,
479
+ "train_runtime": 1492.4083,
480
+ "train_tokens_per_second": 1381.284
481
  },
482
  {
483
  "epoch": 1.0322927879440258,
484
+ "grad_norm": 1.90776789188385,
485
+ "learning_rate": 7.362257627207818e-06,
486
+ "loss": 0.1329,
487
+ "num_input_tokens_seen": 2105216,
488
  "step": 480,
489
+ "train_runtime": 1523.2979,
490
+ "train_tokens_per_second": 1382.012
491
  },
492
  {
493
  "epoch": 1.0538213132400431,
494
+ "grad_norm": 2.7770872116088867,
495
+ "learning_rate": 7.2624245881856094e-06,
496
+ "loss": 0.111,
497
+ "num_input_tokens_seen": 2149888,
498
  "step": 490,
499
+ "train_runtime": 1554.9287,
500
+ "train_tokens_per_second": 1382.628
501
  },
502
  {
503
  "epoch": 1.0753498385360603,
504
+ "grad_norm": 1.9737987518310547,
505
+ "learning_rate": 7.161444169660723e-06,
506
+ "loss": 0.113,
507
+ "num_input_tokens_seen": 2194304,
508
  "step": 500,
509
+ "train_runtime": 1586.2216,
510
+ "train_tokens_per_second": 1383.353
511
  },
512
  {
513
  "epoch": 1.0968783638320776,
514
+ "grad_norm": 1.2335457801818848,
515
+ "learning_rate": 7.059367583445034e-06,
516
+ "loss": 0.1303,
517
+ "num_input_tokens_seen": 2238080,
518
  "step": 510,
519
+ "train_runtime": 1617.0801,
520
+ "train_tokens_per_second": 1384.025
521
  },
522
  {
523
  "epoch": 1.1184068891280947,
524
+ "grad_norm": 2.525258779525757,
525
+ "learning_rate": 6.956246597267438e-06,
526
+ "loss": 0.1404,
527
+ "num_input_tokens_seen": 2282368,
528
  "step": 520,
529
+ "train_runtime": 1648.4109,
530
+ "train_tokens_per_second": 1384.587
531
  },
532
  {
533
  "epoch": 1.1399354144241118,
534
+ "grad_norm": 4.016520977020264,
535
+ "learning_rate": 6.852133508520057e-06,
536
+ "loss": 0.0972,
537
+ "num_input_tokens_seen": 2325984,
538
  "step": 530,
539
+ "train_runtime": 1679.3164,
540
+ "train_tokens_per_second": 1385.078
541
  },
542
  {
543
  "epoch": 1.1614639397201292,
544
+ "grad_norm": 1.405586838722229,
545
+ "learning_rate": 6.747081117735829e-06,
546
+ "loss": 0.1092,
547
+ "num_input_tokens_seen": 2369664,
548
  "step": 540,
549
+ "train_runtime": 1710.2475,
550
+ "train_tokens_per_second": 1385.568
551
  },
552
  {
553
  "epoch": 1.1829924650161463,
554
+ "grad_norm": 2.151442766189575,
555
+ "learning_rate": 6.641142701810932e-06,
556
+ "loss": 0.1186,
557
+ "num_input_tokens_seen": 2413312,
558
  "step": 550,
559
+ "train_runtime": 1741.213,
560
+ "train_tokens_per_second": 1385.995
561
  },
562
  {
563
  "epoch": 1.2045209903121636,
564
+ "grad_norm": 1.9706578254699707,
565
+ "learning_rate": 6.534371986985618e-06,
566
+ "loss": 0.1332,
567
+ "num_input_tokens_seen": 2457120,
568
  "step": 560,
569
+ "train_runtime": 1772.1204,
570
+ "train_tokens_per_second": 1386.542
571
  },
572
  {
573
  "epoch": 1.2260495156081808,
574
+ "grad_norm": 2.3035449981689453,
575
+ "learning_rate": 6.426823121597169e-06,
576
+ "loss": 0.1481,
577
+ "num_input_tokens_seen": 2500736,
578
  "step": 570,
579
+ "train_runtime": 1803.0834,
580
+ "train_tokens_per_second": 1386.922
581
  },
582
  {
583
  "epoch": 1.247578040904198,
584
+ "grad_norm": 3.713632106781006,
585
+ "learning_rate": 6.318550648618785e-06,
586
+ "loss": 0.1332,
587
+ "num_input_tokens_seen": 2545056,
588
  "step": 580,
589
+ "train_runtime": 1834.1935,
590
+ "train_tokens_per_second": 1387.561
591
  },
592
  {
593
  "epoch": 1.2691065662002152,
594
+ "grad_norm": 1.8667478561401367,
595
+ "learning_rate": 6.209609477998339e-06,
596
+ "loss": 0.0978,
597
+ "num_input_tokens_seen": 2588416,
598
  "step": 590,
599
+ "train_runtime": 1864.9784,
600
+ "train_tokens_per_second": 1387.907
601
  },
602
  {
603
  "epoch": 1.2906350914962326,
604
+ "grad_norm": 2.295342445373535,
605
+ "learning_rate": 6.100054858811012e-06,
606
+ "loss": 0.1176,
607
+ "num_input_tokens_seen": 2632352,
608
  "step": 600,
609
+ "train_runtime": 1896.108,
610
+ "train_tokens_per_second": 1388.292
611
  },
612
  {
613
  "epoch": 1.3121636167922497,
614
+ "grad_norm": 2.2867720127105713,
615
+ "learning_rate": 5.989942351239954e-06,
616
+ "loss": 0.1279,
617
+ "num_input_tokens_seen": 2676640,
618
  "step": 610,
619
+ "train_runtime": 1927.5126,
620
+ "train_tokens_per_second": 1388.65
621
  },
622
  {
623
  "epoch": 1.333692142088267,
624
+ "grad_norm": 2.1158223152160645,
625
+ "learning_rate": 5.879327798399155e-06,
626
+ "loss": 0.1407,
627
+ "num_input_tokens_seen": 2719968,
628
  "step": 620,
629
+ "train_runtime": 1958.2576,
630
+ "train_tokens_per_second": 1388.974
631
  },
632
  {
633
  "epoch": 1.3552206673842842,
634
+ "grad_norm": 4.076441287994385,
635
+ "learning_rate": 5.768267298012841e-06,
636
+ "loss": 0.1168,
637
+ "num_input_tokens_seen": 2764352,
638
  "step": 630,
639
+ "train_runtime": 1989.6781,
640
+ "train_tokens_per_second": 1389.346
641
  },
642
  {
643
  "epoch": 1.3767491926803013,
644
+ "grad_norm": 4.354236602783203,
645
+ "learning_rate": 5.656817173965733e-06,
646
+ "loss": 0.1188,
647
+ "num_input_tokens_seen": 2808832,
648
  "step": 640,
649
+ "train_runtime": 2021.0224,
650
+ "train_tokens_per_second": 1389.807
651
  },
652
  {
653
  "epoch": 1.3982777179763186,
654
+ "grad_norm": 4.40167236328125,
655
+ "learning_rate": 5.545033947738624e-06,
656
+ "loss": 0.1326,
657
+ "num_input_tokens_seen": 2852192,
658
  "step": 650,
659
+ "train_runtime": 2051.72,
660
+ "train_tokens_per_second": 1390.147
661
  },
662
  {
663
  "epoch": 1.419806243272336,
664
+ "grad_norm": 2.4845104217529297,
665
+ "learning_rate": 5.4329743097437316e-06,
666
+ "loss": 0.1331,
667
+ "num_input_tokens_seen": 2896256,
668
  "step": 660,
669
+ "train_runtime": 2082.7361,
670
+ "train_tokens_per_second": 1390.602
671
  },
672
  {
673
  "epoch": 1.441334768568353,
674
+ "grad_norm": 2.7233705520629883,
675
+ "learning_rate": 5.320695090574386e-06,
676
+ "loss": 0.1082,
677
+ "num_input_tokens_seen": 2939552,
678
  "step": 670,
679
+ "train_runtime": 2113.5367,
680
+ "train_tokens_per_second": 1390.821
681
  },
682
  {
683
  "epoch": 1.4628632938643702,
684
+ "grad_norm": 3.289949893951416,
685
+ "learning_rate": 5.208253232183625e-06,
686
+ "loss": 0.1184,
687
+ "num_input_tokens_seen": 2984000,
688
  "step": 680,
689
+ "train_runtime": 2144.7931,
690
+ "train_tokens_per_second": 1391.276
691
  },
692
  {
693
  "epoch": 1.4843918191603875,
694
+ "grad_norm": 4.015010833740234,
695
+ "learning_rate": 5.095705759006311e-06,
696
+ "loss": 0.0942,
697
+ "num_input_tokens_seen": 3028192,
698
  "step": 690,
699
+ "train_runtime": 2176.0229,
700
+ "train_tokens_per_second": 1391.618
701
  },
702
  {
703
  "epoch": 1.5059203444564049,
704
+ "grad_norm": 5.474874973297119,
705
+ "learning_rate": 4.9831097490394195e-06,
706
+ "loss": 0.1204,
707
+ "num_input_tokens_seen": 3071392,
708
  "step": 700,
709
+ "train_runtime": 2206.8218,
710
+ "train_tokens_per_second": 1391.772
711
  },
712
  {
713
  "epoch": 1.527448869752422,
714
+ "grad_norm": 2.4211018085479736,
715
+ "learning_rate": 4.870522304895164e-06,
716
+ "loss": 0.1358,
717
+ "num_input_tokens_seen": 3114496,
718
  "step": 710,
719
+ "train_runtime": 2237.5127,
720
+ "train_tokens_per_second": 1391.946
721
  },
722
  {
723
  "epoch": 1.5489773950484391,
724
+ "grad_norm": 2.5446665287017822,
725
+ "learning_rate": 4.758000524841632e-06,
726
+ "loss": 0.1313,
727
+ "num_input_tokens_seen": 3158432,
728
  "step": 720,
729
+ "train_runtime": 2268.6496,
730
+ "train_tokens_per_second": 1392.208
731
  },
732
  {
733
  "epoch": 1.5705059203444565,
734
+ "grad_norm": 5.643487453460693,
735
+ "learning_rate": 4.645601473845636e-06,
736
+ "loss": 0.0879,
737
+ "num_input_tokens_seen": 3201888,
738
  "step": 730,
739
+ "train_runtime": 2299.4823,
740
+ "train_tokens_per_second": 1392.439
741
  },
742
  {
743
  "epoch": 1.5920344456404736,
744
+ "grad_norm": 1.8654100894927979,
745
+ "learning_rate": 4.533382154632442e-06,
746
+ "loss": 0.0977,
747
+ "num_input_tokens_seen": 3245856,
748
  "step": 740,
749
+ "train_runtime": 2330.5679,
750
+ "train_tokens_per_second": 1392.732
751
  },
752
  {
753
  "epoch": 1.6135629709364907,
754
+ "grad_norm": 2.2264926433563232,
755
+ "learning_rate": 4.421399478777064e-06,
756
+ "loss": 0.1483,
757
+ "num_input_tokens_seen": 3290208,
758
  "step": 750,
759
+ "train_runtime": 2361.9169,
760
+ "train_tokens_per_second": 1393.024
761
  },
762
  {
763
  "epoch": 1.635091496232508,
764
+ "grad_norm": 2.8280999660491943,
765
+ "learning_rate": 4.3097102378417985e-06,
766
+ "loss": 0.1285,
767
+ "num_input_tokens_seen": 3333152,
768
  "step": 760,
769
+ "train_runtime": 2392.5926,
770
+ "train_tokens_per_second": 1393.113
771
  },
772
  {
773
  "epoch": 1.6566200215285254,
774
+ "grad_norm": 3.5213840007781982,
775
+ "learning_rate": 4.198371074574597e-06,
776
+ "loss": 0.1475,
777
+ "num_input_tokens_seen": 3377664,
778
  "step": 770,
779
+ "train_runtime": 2423.9491,
780
+ "train_tokens_per_second": 1393.455
781
  },
782
  {
783
  "epoch": 1.6781485468245425,
784
+ "grad_norm": 3.323622226715088,
785
+ "learning_rate": 4.087438454182942e-06,
786
+ "loss": 0.0904,
787
+ "num_input_tokens_seen": 3422400,
788
  "step": 780,
789
+ "train_runtime": 2455.5818,
790
+ "train_tokens_per_second": 1393.723
791
  },
792
  {
793
  "epoch": 1.6996770721205596,
794
+ "grad_norm": 4.368185997009277,
795
+ "learning_rate": 3.976968635697732e-06,
796
+ "loss": 0.1199,
797
+ "num_input_tokens_seen": 3465760,
798
  "step": 790,
799
+ "train_runtime": 2486.3362,
800
+ "train_tokens_per_second": 1393.922
801
  },
802
  {
803
  "epoch": 1.721205597416577,
804
+ "grad_norm": 3.0081822872161865,
805
+ "learning_rate": 3.867017643441746e-06,
806
+ "loss": 0.102,
807
+ "num_input_tokens_seen": 3509760,
808
  "step": 800,
809
+ "train_runtime": 2517.434,
810
+ "train_tokens_per_second": 1394.182
811
  },
812
  {
813
  "epoch": 1.7427341227125943,
814
+ "grad_norm": 3.7257721424102783,
815
+ "learning_rate": 3.757641238617137e-06,
816
+ "loss": 0.1194,
817
+ "num_input_tokens_seen": 3554560,
818
  "step": 810,
819
+ "train_runtime": 2549.4732,
820
+ "train_tokens_per_second": 1394.233
821
  },
822
  {
823
  "epoch": 1.7642626480086114,
824
+ "grad_norm": 3.8365535736083984,
825
+ "learning_rate": 3.648894891026358e-06,
826
+ "loss": 0.1507,
827
+ "num_input_tokens_seen": 3599488,
828
  "step": 820,
829
+ "train_runtime": 2581.0241,
830
+ "train_tokens_per_second": 1394.597
831
  },
832
  {
833
  "epoch": 1.7857911733046286,
834
+ "grad_norm": 2.1309561729431152,
835
+ "learning_rate": 3.5408337509408764e-06,
836
+ "loss": 0.1015,
837
+ "num_input_tokens_seen": 3643680,
838
  "step": 830,
839
+ "train_runtime": 2612.3216,
840
+ "train_tokens_per_second": 1394.805
841
  },
842
  {
843
  "epoch": 1.807319698600646,
844
+ "grad_norm": 2.5082457065582275,
845
+ "learning_rate": 3.4335126211319412e-06,
846
+ "loss": 0.1165,
847
+ "num_input_tokens_seen": 3688160,
848
  "step": 840,
849
+ "train_runtime": 2643.6717,
850
+ "train_tokens_per_second": 1395.09
851
  },
852
  {
853
  "epoch": 1.8288482238966632,
854
+ "grad_norm": 1.4419660568237305,
855
+ "learning_rate": 3.32698592907757e-06,
856
+ "loss": 0.0958,
857
+ "num_input_tokens_seen": 3731392,
858
  "step": 850,
859
+ "train_runtime": 2674.4286,
860
+ "train_tokens_per_second": 1395.211
861
  },
862
  {
863
  "epoch": 1.8503767491926801,
864
+ "grad_norm": 2.402513027191162,
865
+ "learning_rate": 3.2213076993598857e-06,
866
+ "loss": 0.1505,
867
+ "num_input_tokens_seen": 3776128,
868
  "step": 860,
869
+ "train_runtime": 2706.116,
870
+ "train_tokens_per_second": 1395.405
871
  },
872
  {
873
  "epoch": 1.8719052744886975,
874
+ "grad_norm": 0.9779609441757202,
875
+ "learning_rate": 3.1165315262667535e-06,
876
+ "loss": 0.1003,
877
+ "num_input_tokens_seen": 3820896,
878
  "step": 870,
879
+ "train_runtime": 2737.6181,
880
+ "train_tokens_per_second": 1395.701
881
  },
882
  {
883
  "epoch": 1.8934337997847148,
884
+ "grad_norm": 3.727255344390869,
885
+ "learning_rate": 3.012710546611659e-06,
886
+ "loss": 0.1483,
887
+ "num_input_tokens_seen": 3864704,
888
  "step": 880,
889
+ "train_runtime": 2768.6885,
890
+ "train_tokens_per_second": 1395.861
891
  },
892
  {
893
  "epoch": 1.914962325080732,
894
+ "grad_norm": 1.5679094791412354,
895
+ "learning_rate": 2.9098974127856e-06,
896
+ "loss": 0.117,
897
+ "num_input_tokens_seen": 3908544,
898
  "step": 890,
899
+ "train_runtime": 2799.6713,
900
+ "train_tokens_per_second": 1396.072
901
  },
902
  {
903
  "epoch": 1.936490850376749,
904
+ "grad_norm": 2.775408983230591,
905
+ "learning_rate": 2.8081442660546126e-06,
906
+ "loss": 0.1303,
907
+ "num_input_tokens_seen": 3952576,
908
  "step": 900,
909
+ "train_runtime": 2830.9247,
910
+ "train_tokens_per_second": 1396.214
911
  },
912
  {
913
  "epoch": 1.9580193756727664,
914
+ "grad_norm": 1.0387197732925415,
915
+ "learning_rate": 2.7075027101165706e-06,
916
+ "loss": 0.0971,
917
+ "num_input_tokens_seen": 3996416,
918
  "step": 910,
919
+ "train_runtime": 2862.0695,
920
+ "train_tokens_per_second": 1396.338
921
  },
922
  {
923
  "epoch": 1.9795479009687837,
924
+ "grad_norm": 3.794166326522827,
925
+ "learning_rate": 2.6080237849305467e-06,
926
+ "loss": 0.132,
927
+ "num_input_tokens_seen": 4040736,
928
  "step": 920,
929
+ "train_runtime": 2893.2903,
930
+ "train_tokens_per_second": 1396.589
931
  },
932
  {
933
  "epoch": 2.0,
934
+ "grad_norm": 1.547866702079773,
935
+ "learning_rate": 2.5097579408321264e-06,
936
+ "loss": 0.093,
937
+ "num_input_tokens_seen": 4083200,
938
  "step": 930,
939
+ "train_runtime": 2923.2158,
940
+ "train_tokens_per_second": 1396.818
941
  },
942
  {
943
  "epoch": 2.0215285252960173,
944
+ "grad_norm": 3.5177085399627686,
945
+ "learning_rate": 2.4127550129477145e-06,
946
+ "loss": 0.1324,
947
+ "num_input_tokens_seen": 4127040,
948
  "step": 940,
949
+ "train_runtime": 2954.2784,
950
+ "train_tokens_per_second": 1396.971
951
  },
952
  {
953
  "epoch": 2.0430570505920342,
954
+ "grad_norm": 1.8717275857925415,
955
+ "learning_rate": 2.317064195920852e-06,
956
+ "loss": 0.0841,
957
+ "num_input_tokens_seen": 4170816,
958
  "step": 950,
959
+ "train_runtime": 2985.3333,
960
+ "train_tokens_per_second": 1397.102
961
  },
962
  {
963
  "epoch": 2.0645855758880516,
964
+ "grad_norm": 1.233929991722107,
965
+ "learning_rate": 2.2227340189633508e-06,
966
+ "loss": 0.1138,
967
+ "num_input_tokens_seen": 4214272,
968
  "step": 960,
969
+ "train_runtime": 3016.1559,
970
+ "train_tokens_per_second": 1397.233
971
  },
972
  {
973
  "epoch": 2.086114101184069,
974
+ "grad_norm": 1.6053682565689087,
975
+ "learning_rate": 2.1298123212439028e-06,
976
+ "loss": 0.0892,
977
+ "num_input_tokens_seen": 4258592,
978
  "step": 970,
979
+ "train_runtime": 3047.3824,
980
+ "train_tokens_per_second": 1397.459
981
  },
982
  {
983
  "epoch": 2.1076426264800863,
984
+ "grad_norm": 2.4293172359466553,
985
+ "learning_rate": 2.0383462276266347e-06,
986
+ "loss": 0.1277,
987
+ "num_input_tokens_seen": 4302656,
988
  "step": 980,
989
+ "train_runtime": 3078.5923,
990
+ "train_tokens_per_second": 1397.605
991
  },
992
  {
993
  "epoch": 2.129171151776103,
994
+ "grad_norm": 2.0637197494506836,
995
+ "learning_rate": 1.948382124771927e-06,
996
+ "loss": 0.0968,
997
+ "num_input_tokens_seen": 4345888,
998
  "step": 990,
999
+ "train_runtime": 3109.3083,
1000
+ "train_tokens_per_second": 1397.703
1001
  },
1002
  {
1003
  "epoch": 2.1506996770721205,
1004
+ "grad_norm": 3.5659446716308594,
1005
+ "learning_rate": 1.8599656376116026e-06,
1006
+ "loss": 0.1226,
1007
+ "num_input_tokens_seen": 4390528,
1008
  "step": 1000,
1009
+ "train_runtime": 3140.7259,
1010
+ "train_tokens_per_second": 1397.934
1011
  },
1012
  {
1013
  "epoch": 2.172228202368138,
1014
+ "grad_norm": 3.0801503658294678,
1015
+ "learning_rate": 1.773141606210431e-06,
1016
+ "loss": 0.1201,
1017
+ "num_input_tokens_seen": 4434784,
1018
  "step": 1010,
1019
+ "train_runtime": 3178.3674,
1020
+ "train_tokens_per_second": 1395.303
1021
  },
1022
  {
1023
  "epoch": 2.193756727664155,
1024
+ "grad_norm": 2.0641636848449707,
1025
+ "learning_rate": 1.687954063025663e-06,
1026
+ "loss": 0.0966,
1027
+ "num_input_tokens_seen": 4478976,
1028
  "step": 1020,
1029
+ "train_runtime": 3209.6721,
1030
+ "train_tokens_per_second": 1395.462
1031
  },
1032
  {
1033
  "epoch": 2.215285252960172,
1034
+ "grad_norm": 2.951422929763794,
1035
+ "learning_rate": 1.604446210576157e-06,
1036
+ "loss": 0.1143,
1037
+ "num_input_tokens_seen": 4523616,
1038
  "step": 1030,
1039
+ "train_runtime": 3241.2178,
1040
+ "train_tokens_per_second": 1395.653
1041
  },
1042
  {
1043
  "epoch": 2.2368137782561894,
1044
+ "grad_norm": 5.046944618225098,
1045
+ "learning_rate": 1.5226603995323897e-06,
1046
+ "loss": 0.1114,
1047
+ "num_input_tokens_seen": 4567264,
1048
  "step": 1040,
1049
+ "train_runtime": 3272.1686,
1050
+ "train_tokens_per_second": 1395.791
1051
  },
1052
  {
1053
  "epoch": 2.2583423035522068,
1054
+ "grad_norm": 1.3710857629776,
1055
+ "learning_rate": 1.4426381072384866e-06,
1056
+ "loss": 0.0981,
1057
+ "num_input_tokens_seen": 4611104,
1058
  "step": 1050,
1059
+ "train_runtime": 3303.3652,
1060
+ "train_tokens_per_second": 1395.881
1061
  },
1062
  {
1063
  "epoch": 2.2798708288482237,
1064
+ "grad_norm": 2.5878543853759766,
1065
+ "learning_rate": 1.3644199166771531e-06,
1066
+ "loss": 0.1135,
1067
+ "num_input_tokens_seen": 4655040,
1068
  "step": 1060,
1069
+ "train_runtime": 3334.5323,
1070
+ "train_tokens_per_second": 1396.01
1071
  },
1072
  {
1073
  "epoch": 2.301399354144241,
1074
+ "grad_norm": 2.481158494949341,
1075
+ "learning_rate": 1.2880454958881794e-06,
1076
+ "loss": 0.1081,
1077
+ "num_input_tokens_seen": 4698432,
1078
  "step": 1070,
1079
+ "train_runtime": 3365.4557,
1080
+ "train_tokens_per_second": 1396.076
1081
  },
1082
  {
1083
  "epoch": 2.3229278794402584,
1084
+ "grad_norm": 1.2142502069473267,
1085
+ "learning_rate": 1.2135535778509545e-06,
1086
+ "loss": 0.0685,
1087
+ "num_input_tokens_seen": 4742848,
1088
  "step": 1080,
1089
+ "train_runtime": 3396.7938,
1090
+ "train_tokens_per_second": 1396.272
1091
  },
1092
  {
1093
  "epoch": 2.3444564047362757,
1094
+ "grad_norm": 3.040208339691162,
1095
+ "learning_rate": 1.1409819408411898e-06,
1096
+ "loss": 0.0857,
1097
+ "num_input_tokens_seen": 4786944,
1098
  "step": 1090,
1099
+ "train_runtime": 3427.8943,
1100
+ "train_tokens_per_second": 1396.468
1101
  },
1102
  {
1103
  "epoch": 2.3659849300322926,
1104
+ "grad_norm": 1.4514607191085815,
1105
+ "learning_rate": 1.070367389271823e-06,
1106
+ "loss": 0.1008,
1107
+ "num_input_tokens_seen": 4830624,
1108
  "step": 1100,
1109
+ "train_runtime": 3458.8433,
1110
+ "train_tokens_per_second": 1396.601
1111
  },
1112
  {
1113
  "epoch": 2.38751345532831,
1114
+ "grad_norm": 3.533973455429077,
1115
+ "learning_rate": 1.001745735027801e-06,
1116
+ "loss": 0.1137,
1117
+ "num_input_tokens_seen": 4874944,
1118
  "step": 1110,
1119
+ "train_runtime": 3490.3116,
1120
+ "train_tokens_per_second": 1396.707
1121
  },
1122
  {
1123
  "epoch": 2.4090419806243273,
1124
+ "grad_norm": 4.195890426635742,
1125
+ "learning_rate": 9.351517793042408e-07,
1126
+ "loss": 0.1038,
1127
+ "num_input_tokens_seen": 4918496,
1128
  "step": 1120,
1129
+ "train_runtime": 3521.354,
1130
+ "train_tokens_per_second": 1396.763
1131
  },
1132
  {
1133
  "epoch": 2.4305705059203446,
1134
+ "grad_norm": 4.139116287231445,
1135
+ "learning_rate": 8.706192949571262e-07,
1136
+ "loss": 0.1194,
1137
+ "num_input_tokens_seen": 4961920,
1138
  "step": 1130,
1139
+ "train_runtime": 3552.2441,
1140
+ "train_tokens_per_second": 1396.841
1141
  },
1142
  {
1143
  "epoch": 2.4520990312163615,
1144
+ "grad_norm": 3.0998311042785645,
1145
+ "learning_rate": 8.081810093755537e-07,
1146
+ "loss": 0.1161,
1147
+ "num_input_tokens_seen": 5005440,
1148
  "step": 1140,
1149
+ "train_runtime": 3583.1755,
1150
+ "train_tokens_per_second": 1396.928
1151
  },
1152
  {
1153
  "epoch": 2.473627556512379,
1154
+ "grad_norm": 2.2539584636688232,
1155
+ "learning_rate": 7.478685878841629e-07,
1156
+ "loss": 0.1,
1157
+ "num_input_tokens_seen": 5049344,
1158
  "step": 1150,
1159
+ "train_runtime": 3614.3079,
1160
+ "train_tokens_per_second": 1397.043
1161
  },
1162
  {
1163
  "epoch": 2.495156081808396,
1164
+ "grad_norm": 3.1125545501708984,
1165
+ "learning_rate": 6.897126176841978e-07,
1166
+ "loss": 0.0996,
1167
+ "num_input_tokens_seen": 5092896,
1168
  "step": 1160,
1169
+ "train_runtime": 3645.2176,
1170
+ "train_tokens_per_second": 1397.145
1171
  },
1172
  {
1173
  "epoch": 2.5166846071044136,
1174
+ "grad_norm": 3.5130155086517334,
1175
+ "learning_rate": 6.337425923413276e-07,
1176
+ "loss": 0.0944,
1177
+ "num_input_tokens_seen": 5136928,
1178
  "step": 1170,
1179
+ "train_runtime": 3676.3104,
1180
+ "train_tokens_per_second": 1397.305
1181
  },
1182
  {
1183
  "epoch": 2.5382131324004304,
1184
+ "grad_norm": 2.059572696685791,
1185
+ "learning_rate": 5.799868968281075e-07,
1186
+ "loss": 0.08,
1187
+ "num_input_tokens_seen": 5180960,
1188
  "step": 1180,
1189
+ "train_runtime": 3707.5494,
1190
+ "train_tokens_per_second": 1397.408
1191
  },
1192
  {
1193
  "epoch": 2.559741657696448,
1194
+ "grad_norm": 4.341704845428467,
1195
+ "learning_rate": 5.284727931286526e-07,
1196
+ "loss": 0.0962,
1197
+ "num_input_tokens_seen": 5225376,
1198
  "step": 1190,
1199
+ "train_runtime": 3738.9161,
1200
+ "train_tokens_per_second": 1397.564
1201
  },
1202
  {
1203
  "epoch": 2.581270182992465,
1204
+ "grad_norm": 2.8424837589263916,
1205
+ "learning_rate": 4.792264064128327e-07,
1206
+ "loss": 0.094,
1207
+ "num_input_tokens_seen": 5268992,
1208
  "step": 1200,
1209
+ "train_runtime": 3769.9587,
1210
+ "train_tokens_per_second": 1397.626
1211
  },
1212
  {
1213
  "epoch": 2.602798708288482,
1214
+ "grad_norm": 3.76309871673584,
1215
+ "learning_rate": 4.322727117869951e-07,
1216
+ "loss": 0.1005,
1217
+ "num_input_tokens_seen": 5312992,
1218
  "step": 1210,
1219
+ "train_runtime": 3801.0547,
1220
+ "train_tokens_per_second": 1397.768
1221
  },
1222
  {
1223
  "epoch": 2.6243272335844994,
1224
+ "grad_norm": 2.470759153366089,
1225
+ "learning_rate": 3.8763552162794983e-07,
1226
+ "loss": 0.1167,
1227
+ "num_input_tokens_seen": 5356448,
1228
  "step": 1220,
1229
+ "train_runtime": 3831.9201,
1230
+ "train_tokens_per_second": 1397.85
1231
  },
1232
  {
1233
  "epoch": 2.6458557588805167,
1234
+ "grad_norm": 2.948512315750122,
1235
+ "learning_rate": 3.453374735066034e-07,
1236
+ "loss": 0.0907,
1237
+ "num_input_tokens_seen": 5400672,
1238
  "step": 1230,
1239
+ "train_runtime": 3863.178,
1240
+ "train_tokens_per_second": 1397.987
1241
  },
1242
  {
1243
  "epoch": 2.667384284176534,
1244
+ "grad_norm": 2.082956552505493,
1245
+ "learning_rate": 3.054000187074224e-07,
1246
+ "loss": 0.1074,
1247
+ "num_input_tokens_seen": 5444576,
1248
  "step": 1240,
1249
+ "train_runtime": 3894.1783,
1250
+ "train_tokens_per_second": 1398.132
1251
  },
1252
  {
1253
  "epoch": 2.6889128094725514,
1254
+ "grad_norm": 2.035034656524658,
1255
+ "learning_rate": 2.678434113494882e-07,
1256
+ "loss": 0.1128,
1257
+ "num_input_tokens_seen": 5488160,
1258
  "step": 1250,
1259
+ "train_runtime": 3925.0458,
1260
+ "train_tokens_per_second": 1398.241
1261
  },
1262
  {
1263
  "epoch": 2.7104413347685683,
1264
+ "grad_norm": 3.7168209552764893,
1265
+ "learning_rate": 2.326866981147091e-07,
1266
+ "loss": 0.1016,
1267
+ "num_input_tokens_seen": 5532000,
1268
  "step": 1260,
1269
+ "train_runtime": 3956.0804,
1270
+ "train_tokens_per_second": 1398.354
1271
  },
1272
  {
1273
  "epoch": 2.7319698600645856,
1274
+ "grad_norm": 4.349425315856934,
1275
+ "learning_rate": 1.999477085883711e-07,
1276
+ "loss": 0.1052,
1277
+ "num_input_tokens_seen": 5575808,
1278
  "step": 1270,
1279
+ "train_runtime": 3987.1129,
1280
+ "train_tokens_per_second": 1398.458
1281
  },
1282
  {
1283
  "epoch": 2.7534983853606025,
1284
+ "grad_norm": 1.8204060792922974,
1285
+ "learning_rate": 1.6964304621693516e-07,
1286
+ "loss": 0.0918,
1287
+ "num_input_tokens_seen": 5619200,
1288
  "step": 1280,
1289
+ "train_runtime": 4017.8653,
1290
+ "train_tokens_per_second": 1398.554
1291
  },
1292
  {
1293
  "epoch": 2.77502691065662,
1294
+ "grad_norm": 3.752577066421509,
1295
+ "learning_rate": 1.4178807988766419e-07,
1296
+ "loss": 0.109,
1297
+ "num_input_tokens_seen": 5662656,
1298
  "step": 1290,
1299
+ "train_runtime": 4048.795,
1300
+ "train_tokens_per_second": 1398.603
1301
  },
1302
  {
1303
  "epoch": 2.7965554359526372,
1304
+ "grad_norm": 3.749866247177124,
1305
+ "learning_rate": 1.1639693613435921e-07,
1306
+ "loss": 0.1224,
1307
+ "num_input_tokens_seen": 5706656,
1308
  "step": 1300,
1309
+ "train_runtime": 4079.9279,
1310
+ "train_tokens_per_second": 1398.715
1311
  },
1312
  {
1313
  "epoch": 2.8180839612486546,
1314
+ "grad_norm": 2.628767251968384,
1315
+ "learning_rate": 9.348249197313918e-08,
1316
+ "loss": 0.0992,
1317
+ "num_input_tokens_seen": 5751232,
1318
  "step": 1310,
1319
+ "train_runtime": 4111.4798,
1320
+ "train_tokens_per_second": 1398.823
1321
  },
1322
  {
1323
  "epoch": 2.839612486544672,
1324
+ "grad_norm": 0.7992174625396729,
1325
+ "learning_rate": 7.305636837191876e-08,
1326
+ "loss": 0.107,
1327
+ "num_input_tokens_seen": 5794976,
1328
  "step": 1320,
1329
+ "train_runtime": 4142.503,
1330
+ "train_tokens_per_second": 1398.907
1331
  },
1332
  {
1333
  "epoch": 2.861141011840689,
1334
+ "grad_norm": 3.0042312145233154,
1335
+ "learning_rate": 5.512892435687645e-08,
1336
+ "loss": 0.0944,
1337
+ "num_input_tokens_seen": 5838368,
1338
  "step": 1330,
1339
+ "train_runtime": 4173.35,
1340
+ "train_tokens_per_second": 1398.964
1341
  },
1342
  {
1343
  "epoch": 2.882669537136706,
1344
+ "grad_norm": 3.208315134048462,
1345
+ "learning_rate": 3.970925175892093e-08,
1346
+ "loss": 0.0867,
1347
+ "num_input_tokens_seen": 5881984,
1348
  "step": 1340,
1349
+ "train_runtime": 4204.3268,
1350
+ "train_tokens_per_second": 1399.031
1351
  },
1352
  {
1353
  "epoch": 2.9041980624327235,
1354
+ "grad_norm": 3.5772690773010254,
1355
+ "learning_rate": 2.6805170602803297e-08,
1356
+ "loss": 0.1075,
1357
+ "num_input_tokens_seen": 5925664,
1358
  "step": 1350,
1359
+ "train_runtime": 4235.1869,
1360
+ "train_tokens_per_second": 1399.151
1361
  },
1362
  {
1363
  "epoch": 2.9257265877287404,
1364
+ "grad_norm": 3.261751413345337,
1365
+ "learning_rate": 1.6423225141223854e-08,
1366
+ "loss": 0.1042,
1367
+ "num_input_tokens_seen": 5969408,
1368
  "step": 1360,
1369
+ "train_runtime": 4266.2069,
1370
+ "train_tokens_per_second": 1399.231
1371
  },
1372
  {
1373
  "epoch": 2.9472551130247577,
1374
+ "grad_norm": 4.744147300720215,
1375
+ "learning_rate": 8.568680535939177e-09,
1376
+ "loss": 0.0964,
1377
+ "num_input_tokens_seen": 6012576,
1378
  "step": 1370,
1379
+ "train_runtime": 4297.0229,
1380
+ "train_tokens_per_second": 1399.242
1381
  },
1382
  {
1383
  "epoch": 2.968783638320775,
1384
+ "grad_norm": 2.3966517448425293,
1385
+ "learning_rate": 3.2455201875586372e-09,
1386
+ "loss": 0.0922,
1387
+ "num_input_tokens_seen": 6056000,
1388
  "step": 1380,
1389
+ "train_runtime": 4328.462,
1390
+ "train_tokens_per_second": 1399.111
1391
  },
1392
  {
1393
  "epoch": 2.9903121636167924,
1394
+ "grad_norm": 1.2950575351715088,
1395
+ "learning_rate": 4.5644371537756363e-10,
1396
+ "loss": 0.115,
1397
+ "num_input_tokens_seen": 6100192,
1398
  "step": 1390,
1399
+ "train_runtime": 4359.7222,
1400
+ "train_tokens_per_second": 1399.216
1401
  },
1402
  {
1403
  "epoch": 3.0,
1404
+ "num_input_tokens_seen": 6120032,
1405
  "step": 1395,
1406
+ "total_flos": 4.115769119160883e+17,
1407
+ "train_loss": 0.1491297289889346,
1408
+ "train_runtime": 4379.932,
1409
+ "train_samples_per_second": 2.545,
1410
+ "train_steps_per_second": 0.318
1411
  }
1412
  ],
1413
  "logging_steps": 10,
1414
  "max_steps": 1395,
1415
+ "num_input_tokens_seen": 6120032,
1416
  "num_train_epochs": 3,
1417
  "save_steps": 1000,
1418
  "stateful_callbacks": {
 
1427
  "attributes": {}
1428
  }
1429
  },
1430
+ "total_flos": 4.115769119160883e+17,
1431
  "train_batch_size": 4,
1432
  "trial_name": null,
1433
  "trial_params": null
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9c29c975621e6dfe5a87aa7a2dbd3a9fa540f81cbdafb9999ffa93dc268922e3
3
  size 6161
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:57039f57f730004d2db4291a164c9a267ccb02be9b83d34e8933cba3e52ae325
3
  size 6161
training_args.yaml CHANGED
@@ -1,3 +1,4 @@
 
1
  cutoff_len: 2048
2
  dataset: treino_pt_rde3
3
  dataset_dir: data
@@ -7,14 +8,13 @@ double_quantization: true
7
  enable_thinking: true
8
  finetuning_type: lora
9
  flash_attn: auto
10
- fp16: true
11
  freeze_multi_modal_projector: true
12
  freeze_vision_tower: true
13
  gradient_accumulation_steps: 2
14
  image_max_pixels: 589824
15
  image_min_pixels: 1024
16
  include_num_input_tokens_seen: true
17
- learning_rate: 3.0e-05
18
  logging_steps: 10
19
  lora_alpha: 16
20
  lora_dropout: 0
@@ -36,7 +36,7 @@ quantization_method: bnb
36
  report_to: none
37
  save_steps: 1000
38
  stage: sft
39
- template: alpaca
40
  trust_remote_code: true
41
  use_unsloth: true
42
  video_max_pixels: 65536
 
1
+ bf16: true
2
  cutoff_len: 2048
3
  dataset: treino_pt_rde3
4
  dataset_dir: data
 
8
  enable_thinking: true
9
  finetuning_type: lora
10
  flash_attn: auto
 
11
  freeze_multi_modal_projector: true
12
  freeze_vision_tower: true
13
  gradient_accumulation_steps: 2
14
  image_max_pixels: 589824
15
  image_min_pixels: 1024
16
  include_num_input_tokens_seen: true
17
+ learning_rate: 1.0e-05
18
  logging_steps: 10
19
  lora_alpha: 16
20
  lora_dropout: 0
 
36
  report_to: none
37
  save_steps: 1000
38
  stage: sft
39
+ template: gemma3
40
  trust_remote_code: true
41
  use_unsloth: true
42
  video_max_pixels: 65536
training_loss.png CHANGED