Upload entire model folder
Browse files- out/hard_gate_100_run/chat_template.jinja +15 -0
- out/hard_gate_100_run/checkpoint-10000/chat_template.jinja +15 -0
- out/hard_gate_100_run/checkpoint-10000/config.json +34 -0
- out/hard_gate_100_run/checkpoint-10000/model.safetensors +3 -0
- out/hard_gate_100_run/checkpoint-10000/optimizer.pt +3 -0
- out/hard_gate_100_run/checkpoint-10000/rng_state.pth +3 -0
- out/hard_gate_100_run/checkpoint-10000/scheduler.pt +3 -0
- out/hard_gate_100_run/checkpoint-10000/tokenizer.json +0 -0
- out/hard_gate_100_run/checkpoint-10000/tokenizer_config.json +16 -0
- out/hard_gate_100_run/checkpoint-10000/trainer_state.json +0 -0
- out/hard_gate_100_run/checkpoint-10000/training_args.bin +3 -0
- out/hard_gate_100_run/checkpoint-9000/chat_template.jinja +15 -0
- out/hard_gate_100_run/checkpoint-9000/config.json +34 -0
- out/hard_gate_100_run/checkpoint-9000/model.safetensors +3 -0
- out/hard_gate_100_run/checkpoint-9000/optimizer.pt +3 -0
- out/hard_gate_100_run/checkpoint-9000/rng_state.pth +3 -0
- out/hard_gate_100_run/checkpoint-9000/scheduler.pt +3 -0
- out/hard_gate_100_run/checkpoint-9000/tokenizer.json +0 -0
- out/hard_gate_100_run/checkpoint-9000/tokenizer_config.json +16 -0
- out/hard_gate_100_run/checkpoint-9000/trainer_state.json +0 -0
- out/hard_gate_100_run/checkpoint-9000/training_args.bin +3 -0
- out/hard_gate_100_run/config.json +34 -0
- out/hard_gate_100_run/model.safetensors +3 -0
- out/hard_gate_100_run/tokenizer.json +0 -0
- out/hard_gate_100_run/tokenizer_config.json +16 -0
- out/hard_gate_100_run/training_args.bin +3 -0
- out/hard_gate_100_run/training_log.jsonl +141 -0
out/hard_gate_100_run/chat_template.jinja
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{% for message in messages %}
|
| 2 |
+
{% if message['role'] == 'user' %}
|
| 3 |
+
{{ '<|user|>
|
| 4 |
+
' + message['content'] + eos_token }}
|
| 5 |
+
{% elif message['role'] == 'system' %}
|
| 6 |
+
{{ '<|system|>
|
| 7 |
+
' + message['content'] + eos_token }}
|
| 8 |
+
{% elif message['role'] == 'assistant' %}
|
| 9 |
+
{{ '<|assistant|>
|
| 10 |
+
' + message['content'] + eos_token }}
|
| 11 |
+
{% endif %}
|
| 12 |
+
{% if loop.last and add_generation_prompt %}
|
| 13 |
+
{{ '<|assistant|>' }}
|
| 14 |
+
{% endif %}
|
| 15 |
+
{% endfor %}
|
out/hard_gate_100_run/checkpoint-10000/chat_template.jinja
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{% for message in messages %}
|
| 2 |
+
{% if message['role'] == 'user' %}
|
| 3 |
+
{{ '<|user|>
|
| 4 |
+
' + message['content'] + eos_token }}
|
| 5 |
+
{% elif message['role'] == 'system' %}
|
| 6 |
+
{{ '<|system|>
|
| 7 |
+
' + message['content'] + eos_token }}
|
| 8 |
+
{% elif message['role'] == 'assistant' %}
|
| 9 |
+
{{ '<|assistant|>
|
| 10 |
+
' + message['content'] + eos_token }}
|
| 11 |
+
{% endif %}
|
| 12 |
+
{% if loop.last and add_generation_prompt %}
|
| 13 |
+
{{ '<|assistant|>' }}
|
| 14 |
+
{% endif %}
|
| 15 |
+
{% endfor %}
|
out/hard_gate_100_run/checkpoint-10000/config.json
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"TinyLlamaForCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 1,
|
| 8 |
+
"dtype": "float32",
|
| 9 |
+
"eos_token_id": 2,
|
| 10 |
+
"glu_activation": "hard_gate_100",
|
| 11 |
+
"head_dim": 64,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 512,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 768,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"model_type": "tiny_llama",
|
| 19 |
+
"num_attention_heads": 8,
|
| 20 |
+
"num_hidden_layers": 8,
|
| 21 |
+
"num_key_value_heads": 8,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pretraining_tp": 1,
|
| 24 |
+
"rms_norm_eps": 1e-06,
|
| 25 |
+
"rope_parameters": {
|
| 26 |
+
"rope_theta": 10000.0,
|
| 27 |
+
"rope_type": "default"
|
| 28 |
+
},
|
| 29 |
+
"tie_word_embeddings": true,
|
| 30 |
+
"tokenizer_name": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
|
| 31 |
+
"transformers_version": "5.15.0.dev0",
|
| 32 |
+
"use_cache": false,
|
| 33 |
+
"vocab_size": 32000
|
| 34 |
+
}
|
out/hard_gate_100_run/checkpoint-10000/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:30f6adb5912d1ddd89aada760b06c10c2c1554f38286050d233be4f855f2946f
|
| 3 |
+
size 136882104
|
out/hard_gate_100_run/checkpoint-10000/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:22f70abd79991ae3df32a568d9606c987aca0c761f300cb0ffe63019ed9e021e
|
| 3 |
+
size 248638074
|
out/hard_gate_100_run/checkpoint-10000/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:645b71843375baf4cc10bc75a2f0f04e91b8e3f8e8929f518a87022898b3bc20
|
| 3 |
+
size 14244
|
out/hard_gate_100_run/checkpoint-10000/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4943a4b68e3bb4800466ee6c597a8242d165d5e3adaf59ebce14536925495437
|
| 3 |
+
size 1064
|
out/hard_gate_100_run/checkpoint-10000/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/hard_gate_100_run/checkpoint-10000/tokenizer_config.json
ADDED
|
@@ -0,0 +1,16 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": null,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<s>",
|
| 5 |
+
"clean_up_tokenization_spaces": false,
|
| 6 |
+
"eos_token": "</s>",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 2048,
|
| 10 |
+
"pad_token": "</s>",
|
| 11 |
+
"padding_side": "right",
|
| 12 |
+
"sp_model_kwargs": {},
|
| 13 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 14 |
+
"unk_token": "<unk>",
|
| 15 |
+
"use_default_system_prompt": false
|
| 16 |
+
}
|
out/hard_gate_100_run/checkpoint-10000/trainer_state.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/hard_gate_100_run/checkpoint-10000/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e92deb2fee1b860c1d7bdf0ce2eead84bd265be0f62c7338e60c7c49c084a52d
|
| 3 |
+
size 4856
|
out/hard_gate_100_run/checkpoint-9000/chat_template.jinja
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{% for message in messages %}
|
| 2 |
+
{% if message['role'] == 'user' %}
|
| 3 |
+
{{ '<|user|>
|
| 4 |
+
' + message['content'] + eos_token }}
|
| 5 |
+
{% elif message['role'] == 'system' %}
|
| 6 |
+
{{ '<|system|>
|
| 7 |
+
' + message['content'] + eos_token }}
|
| 8 |
+
{% elif message['role'] == 'assistant' %}
|
| 9 |
+
{{ '<|assistant|>
|
| 10 |
+
' + message['content'] + eos_token }}
|
| 11 |
+
{% endif %}
|
| 12 |
+
{% if loop.last and add_generation_prompt %}
|
| 13 |
+
{{ '<|assistant|>' }}
|
| 14 |
+
{% endif %}
|
| 15 |
+
{% endfor %}
|
out/hard_gate_100_run/checkpoint-9000/config.json
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"TinyLlamaForCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 1,
|
| 8 |
+
"dtype": "float32",
|
| 9 |
+
"eos_token_id": 2,
|
| 10 |
+
"glu_activation": "hard_gate_100",
|
| 11 |
+
"head_dim": 64,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 512,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 768,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"model_type": "tiny_llama",
|
| 19 |
+
"num_attention_heads": 8,
|
| 20 |
+
"num_hidden_layers": 8,
|
| 21 |
+
"num_key_value_heads": 8,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pretraining_tp": 1,
|
| 24 |
+
"rms_norm_eps": 1e-06,
|
| 25 |
+
"rope_parameters": {
|
| 26 |
+
"rope_theta": 10000.0,
|
| 27 |
+
"rope_type": "default"
|
| 28 |
+
},
|
| 29 |
+
"tie_word_embeddings": true,
|
| 30 |
+
"tokenizer_name": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
|
| 31 |
+
"transformers_version": "5.15.0.dev0",
|
| 32 |
+
"use_cache": false,
|
| 33 |
+
"vocab_size": 32000
|
| 34 |
+
}
|
out/hard_gate_100_run/checkpoint-9000/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1dc3da737894bc39b8ecf2c618a59b770c7af8e2e3228d5cbd43d4fb6c715e02
|
| 3 |
+
size 136882104
|
out/hard_gate_100_run/checkpoint-9000/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f4c27cee5fbcd0e1a5bf626cd8801c9f7e4bca5c5575a9d2081e0d2beb0461e3
|
| 3 |
+
size 248638074
|
out/hard_gate_100_run/checkpoint-9000/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:86a2aa7bca84d2b8e7dd4e04a286714ba9169af11c46c739950a52df4c45259f
|
| 3 |
+
size 14244
|
out/hard_gate_100_run/checkpoint-9000/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bede406dc99092b1999c6419d28e2ca4fcd37bc1ad90776facaeda39b41f2f8e
|
| 3 |
+
size 1064
|
out/hard_gate_100_run/checkpoint-9000/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/hard_gate_100_run/checkpoint-9000/tokenizer_config.json
ADDED
|
@@ -0,0 +1,16 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": null,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<s>",
|
| 5 |
+
"clean_up_tokenization_spaces": false,
|
| 6 |
+
"eos_token": "</s>",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 2048,
|
| 10 |
+
"pad_token": "</s>",
|
| 11 |
+
"padding_side": "right",
|
| 12 |
+
"sp_model_kwargs": {},
|
| 13 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 14 |
+
"unk_token": "<unk>",
|
| 15 |
+
"use_default_system_prompt": false
|
| 16 |
+
}
|
out/hard_gate_100_run/checkpoint-9000/trainer_state.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/hard_gate_100_run/checkpoint-9000/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e92deb2fee1b860c1d7bdf0ce2eead84bd265be0f62c7338e60c7c49c084a52d
|
| 3 |
+
size 4856
|
out/hard_gate_100_run/config.json
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"TinyLlamaForCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 1,
|
| 8 |
+
"dtype": "float32",
|
| 9 |
+
"eos_token_id": 2,
|
| 10 |
+
"glu_activation": "hard_gate_100",
|
| 11 |
+
"head_dim": 64,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 512,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 768,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"model_type": "tiny_llama",
|
| 19 |
+
"num_attention_heads": 8,
|
| 20 |
+
"num_hidden_layers": 8,
|
| 21 |
+
"num_key_value_heads": 8,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pretraining_tp": 1,
|
| 24 |
+
"rms_norm_eps": 1e-06,
|
| 25 |
+
"rope_parameters": {
|
| 26 |
+
"rope_theta": 10000.0,
|
| 27 |
+
"rope_type": "default"
|
| 28 |
+
},
|
| 29 |
+
"tie_word_embeddings": true,
|
| 30 |
+
"tokenizer_name": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
|
| 31 |
+
"transformers_version": "5.15.0.dev0",
|
| 32 |
+
"use_cache": false,
|
| 33 |
+
"vocab_size": 32000
|
| 34 |
+
}
|
out/hard_gate_100_run/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:30f6adb5912d1ddd89aada760b06c10c2c1554f38286050d233be4f855f2946f
|
| 3 |
+
size 136882104
|
out/hard_gate_100_run/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/hard_gate_100_run/tokenizer_config.json
ADDED
|
@@ -0,0 +1,16 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": null,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<s>",
|
| 5 |
+
"clean_up_tokenization_spaces": false,
|
| 6 |
+
"eos_token": "</s>",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 2048,
|
| 10 |
+
"pad_token": "</s>",
|
| 11 |
+
"padding_side": "right",
|
| 12 |
+
"sp_model_kwargs": {},
|
| 13 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 14 |
+
"unk_token": "<unk>",
|
| 15 |
+
"use_default_system_prompt": false
|
| 16 |
+
}
|
out/hard_gate_100_run/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e92deb2fee1b860c1d7bdf0ce2eead84bd265be0f62c7338e60c7c49c084a52d
|
| 3 |
+
size 4856
|
out/hard_gate_100_run/training_log.jsonl
CHANGED
|
@@ -879,3 +879,144 @@
|
|
| 879 |
{"step": 8620, "epoch": 0.5514329580348004, "timestamp": 1785722463.8881633, "loss": 3.0464391708374023, "grad_norm": 0.7131586074829102, "learning_rate": 0.0003, "train/total_time_seconds": 851.4561523497105, "train/time_per_step_avg": 0.09967306729406118, "train/epoch_time_elapsed": 1501.7110983207822, "train/estimated_remaining_minutes": 2.271866763810132}
|
| 880 |
{"step": 8630, "epoch": 0.5520726714431935, "timestamp": 1785722465.354069, "loss": 3.078175354003906, "grad_norm": 0.7398413419723511, "learning_rate": 0.0003, "train/total_time_seconds": 852.4406961128116, "train/time_per_step_avg": 0.09972071312367917, "train/epoch_time_elapsed": 1503.1770041696727, "train/estimated_remaining_minutes": 2.255395430039691}
|
| 881 |
{"step": 8640, "epoch": 0.5527123848515865, "timestamp": 1785722466.8211143, "loss": 3.053715133666992, "grad_norm": 0.7541388273239136, "learning_rate": 0.0003, "train/total_time_seconds": 853.4258072413504, "train/time_per_step_avg": 0.09978159189224244, "train/epoch_time_elapsed": 1504.6440487392247, "train/estimated_remaining_minutes": 2.2389257288739133}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 879 |
{"step": 8620, "epoch": 0.5514329580348004, "timestamp": 1785722463.8881633, "loss": 3.0464391708374023, "grad_norm": 0.7131586074829102, "learning_rate": 0.0003, "train/total_time_seconds": 851.4561523497105, "train/time_per_step_avg": 0.09967306729406118, "train/epoch_time_elapsed": 1501.7110983207822, "train/estimated_remaining_minutes": 2.271866763810132}
|
| 880 |
{"step": 8630, "epoch": 0.5520726714431935, "timestamp": 1785722465.354069, "loss": 3.078175354003906, "grad_norm": 0.7398413419723511, "learning_rate": 0.0003, "train/total_time_seconds": 852.4406961128116, "train/time_per_step_avg": 0.09972071312367917, "train/epoch_time_elapsed": 1503.1770041696727, "train/estimated_remaining_minutes": 2.255395430039691}
|
| 881 |
{"step": 8640, "epoch": 0.5527123848515865, "timestamp": 1785722466.8211143, "loss": 3.053715133666992, "grad_norm": 0.7541388273239136, "learning_rate": 0.0003, "train/total_time_seconds": 853.4258072413504, "train/time_per_step_avg": 0.09978159189224244, "train/epoch_time_elapsed": 1504.6440487392247, "train/estimated_remaining_minutes": 2.2389257288739133}
|
| 882 |
+
{"step": 8650, "epoch": 0.5533520982599796, "timestamp": 1785722468.3056357, "loss": 3.038742446899414, "grad_norm": 0.7196696996688843, "learning_rate": 0.0003, "train/total_time_seconds": 854.4145545847714, "train/time_per_step_avg": 0.09984538707882167, "train/epoch_time_elapsed": 1506.128570470959, "train/estimated_remaining_minutes": 2.222465604411255}
|
| 883 |
+
{"step": 8660, "epoch": 0.5539918116683725, "timestamp": 1785722469.7705474, "loss": 3.0279184341430665, "grad_norm": 0.72295081615448, "learning_rate": 0.0003, "train/total_time_seconds": 855.3978427015245, "train/time_per_step_avg": 0.09983505509793758, "train/epoch_time_elapsed": 1507.5934813581407, "train/estimated_remaining_minutes": 2.2059913572364183}
|
| 884 |
+
{"step": 8670, "epoch": 0.5546315250767656, "timestamp": 1785722471.2313569, "loss": 3.038762664794922, "grad_norm": 0.75661700963974, "learning_rate": 0.0003, "train/total_time_seconds": 856.3802621625364, "train/time_per_step_avg": 0.09970384702086449, "train/epoch_time_elapsed": 1509.0542917884886, "train/estimated_remaining_minutes": 2.1895150878050242}
|
| 885 |
+
{"step": 8680, "epoch": 0.5552712384851587, "timestamp": 1785722472.6943502, "loss": 3.0164253234863283, "grad_norm": 0.7571326494216919, "learning_rate": 0.0003, "train/total_time_seconds": 857.3641470186412, "train/time_per_step_avg": 0.09970626324415206, "train/epoch_time_elapsed": 1510.5172852352262, "train/estimated_remaining_minutes": 2.1730427689412566}
|
| 886 |
+
{"step": 8690, "epoch": 0.5559109518935517, "timestamp": 1785722474.1581204, "loss": 3.0274606704711915, "grad_norm": 0.7318217158317566, "learning_rate": 0.0003, "train/total_time_seconds": 858.3486200496554, "train/time_per_step_avg": 0.0996659792587161, "train/epoch_time_elapsed": 1511.9810558371246, "train/estimated_remaining_minutes": 2.1565720987055017}
|
| 887 |
+
{"step": 8700, "epoch": 0.5565506653019447, "timestamp": 1785722475.638754, "loss": 3.089097595214844, "grad_norm": 0.7549241781234741, "learning_rate": 0.0003, "train/total_time_seconds": 859.3486608304083, "train/time_per_step_avg": 0.09981235958635808, "train/epoch_time_elapsed": 1513.4616886675358, "train/estimated_remaining_minutes": 2.140140343064236}
|
| 888 |
+
{"step": 8710, "epoch": 0.5571903787103377, "timestamp": 1785722477.1017978, "loss": 3.050891304016113, "grad_norm": 0.7214218378067017, "learning_rate": 0.0003, "train/total_time_seconds": 860.3316439390182, "train/time_per_step_avg": 0.09857764709740877, "train/epoch_time_elapsed": 1514.924732144922, "train/estimated_remaining_minutes": 2.123665940836842}
|
| 889 |
+
{"step": 8720, "epoch": 0.5578300921187308, "timestamp": 1785722478.5697238, "loss": 3.021912956237793, "grad_norm": 0.7184545397758484, "learning_rate": 0.0003, "train/total_time_seconds": 861.3137190937996, "train/time_per_step_avg": 0.09857566744089126, "train/epoch_time_elapsed": 1516.3926591724157, "train/estimated_remaining_minutes": 2.1071895268349836}
|
| 890 |
+
{"step": 8730, "epoch": 0.5584698055271239, "timestamp": 1785722480.0255892, "loss": 3.0774557113647463, "grad_norm": 0.7441939115524292, "learning_rate": 0.0003, "train/total_time_seconds": 862.2931791730225, "train/time_per_step_avg": 0.09852483060210943, "train/epoch_time_elapsed": 1517.848524838686, "train/estimated_remaining_minutes": 2.0907070209044263}
|
| 891 |
+
{"step": 8740, "epoch": 0.5591095189355169, "timestamp": 1785722481.4866698, "loss": 3.117899703979492, "grad_norm": 0.7651569843292236, "learning_rate": 0.0003, "train/total_time_seconds": 863.2729869484901, "train/time_per_step_avg": 0.0984717970713973, "train/epoch_time_elapsed": 1519.3096050433815, "train/estimated_remaining_minutes": 2.074225712347631}
|
| 892 |
+
{"step": 8750, "epoch": 0.5597492323439099, "timestamp": 1785722482.9416313, "loss": 3.044895553588867, "grad_norm": 0.7431774139404297, "learning_rate": 0.0003, "train/total_time_seconds": 864.2525893226266, "train/time_per_step_avg": 0.09838034737855196, "train/epoch_time_elapsed": 1520.7645664215088, "train/estimated_remaining_minutes": 2.057744260291968}
|
| 893 |
+
{"step": 8760, "epoch": 0.5603889457523029, "timestamp": 1785722484.4049437, "loss": 3.0727338790893555, "grad_norm": 0.7436034679412842, "learning_rate": 0.0003, "train/total_time_seconds": 865.2363535165787, "train/time_per_step_avg": 0.09838510815054179, "train/epoch_time_elapsed": 1522.2278784662485, "train/estimated_remaining_minutes": 2.041272980138047}
|
| 894 |
+
{"step": 8770, "epoch": 0.561028659160696, "timestamp": 1785722485.9287238, "loss": 3.0417957305908203, "grad_norm": 0.7413555979728699, "learning_rate": 0.0003, "train/total_time_seconds": 866.2249453775585, "train/time_per_step_avg": 0.09844683215022088, "train/epoch_time_elapsed": 1523.751658923924, "train/estimated_remaining_minutes": 2.0248131562417275}
|
| 895 |
+
{"step": 8780, "epoch": 0.5616683725690891, "timestamp": 1785722487.4063046, "loss": 3.079096794128418, "grad_norm": 0.7495974898338318, "learning_rate": 0.0003, "train/total_time_seconds": 867.2135899811983, "train/time_per_step_avg": 0.09849442962557077, "train/epoch_time_elapsed": 1525.22923970595, "train/estimated_remaining_minutes": 2.008353416433299}
|
| 896 |
+
{"step": 8790, "epoch": 0.562308085977482, "timestamp": 1785722488.8763669, "loss": 3.031002426147461, "grad_norm": 0.7082793712615967, "learning_rate": 0.0003, "train/total_time_seconds": 868.1993219070137, "train/time_per_step_avg": 0.09850701857358217, "train/epoch_time_elapsed": 1526.6993015930057, "train/estimated_remaining_minutes": 1.9918869539391098}
|
| 897 |
+
{"step": 8800, "epoch": 0.5629477993858751, "timestamp": 1785722490.373633, "loss": 3.0218570709228514, "grad_norm": 0.7194830179214478, "learning_rate": 0.0003, "train/total_time_seconds": 869.1872727908194, "train/time_per_step_avg": 0.09838611960411071, "train/epoch_time_elapsed": 1528.1965677067637, "train/estimated_remaining_minutes": 1.9754256199791351}
|
| 898 |
+
{"step": 8810, "epoch": 0.5635875127942682, "timestamp": 1785722492.0502036, "loss": 3.071324920654297, "grad_norm": 0.7415862083435059, "learning_rate": 0.0003, "train/total_time_seconds": 870.3261661417782, "train/time_per_step_avg": 0.09994522202759981, "train/epoch_time_elapsed": 1529.8731390349567, "train/estimated_remaining_minutes": 1.9593040819309802}
|
| 899 |
+
{"step": 8820, "epoch": 0.5642272262026612, "timestamp": 1785722493.5227067, "loss": 3.0318977355957033, "grad_norm": 0.7268640398979187, "learning_rate": 0.0003, "train/total_time_seconds": 871.3183387331665, "train/time_per_step_avg": 0.10004619639366866, "train/epoch_time_elapsed": 1531.345641400665, "train/estimated_remaining_minutes": 1.9428489034488594}
|
| 900 |
+
{"step": 8830, "epoch": 0.5648669396110543, "timestamp": 1785722494.9866264, "loss": 3.0086639404296873, "grad_norm": 0.7441633939743042, "learning_rate": 0.0003, "train/total_time_seconds": 872.3019276335835, "train/time_per_step_avg": 0.10008748460561037, "train/epoch_time_elapsed": 1532.8095617480576, "train/estimated_remaining_minutes": 1.9263745853742786}
|
| 901 |
+
{"step": 8840, "epoch": 0.5655066530194472, "timestamp": 1785722496.4487598, "loss": 3.067409706115723, "grad_norm": 0.7246983051300049, "learning_rate": 0.0003, "train/total_time_seconds": 873.2847953699529, "train/time_per_step_avg": 0.10011808421462774, "train/epoch_time_elapsed": 1534.2716952040792, "train/estimated_remaining_minutes": 1.9098988737351912}
|
| 902 |
+
{"step": 8850, "epoch": 0.5661463664278403, "timestamp": 1785722497.9115274, "loss": 3.0507156372070314, "grad_norm": 0.7237312197685242, "learning_rate": 0.0003, "train/total_time_seconds": 874.2660032622516, "train/time_per_step_avg": 0.10013413939625025, "train/epoch_time_elapsed": 1535.7344624213874, "train/estimated_remaining_minutes": 1.8934197810764395}
|
| 903 |
+
{"step": 8860, "epoch": 0.5667860798362334, "timestamp": 1785722499.4097018, "loss": 3.053671646118164, "grad_norm": 0.71001136302948, "learning_rate": 0.0003, "train/total_time_seconds": 875.2555930428207, "train/time_per_step_avg": 0.10019239526242017, "train/epoch_time_elapsed": 1537.2326368317008, "train/estimated_remaining_minutes": 1.8769589467058232}
|
| 904 |
+
{"step": 8870, "epoch": 0.5674257932446264, "timestamp": 1785722500.8693218, "loss": 3.0408756256103517, "grad_norm": 0.724812924861908, "learning_rate": 0.0003, "train/total_time_seconds": 876.2376344949007, "train/time_per_step_avg": 0.10012689117342234, "train/epoch_time_elapsed": 1538.692256975919, "train/estimated_remaining_minutes": 1.8604820123623407}
|
| 905 |
+
{"step": 8880, "epoch": 0.5680655066530195, "timestamp": 1785722502.3373523, "loss": 3.0706581115722655, "grad_norm": 0.7398186326026917, "learning_rate": 0.0003, "train/total_time_seconds": 877.2215979546309, "train/time_per_step_avg": 0.10008007973432541, "train/epoch_time_elapsed": 1540.1602859012783, "train/estimated_remaining_minutes": 1.8440093650697946}
|
| 906 |
+
{"step": 8890, "epoch": 0.5687052200614124, "timestamp": 1785722503.8045816, "loss": 3.0441017150878906, "grad_norm": 0.7482318878173828, "learning_rate": 0.0003, "train/total_time_seconds": 878.2054796181619, "train/time_per_step_avg": 0.10006157711148261, "train/epoch_time_elapsed": 1541.6275169029832, "train/estimated_remaining_minutes": 1.8275367123662538}
|
| 907 |
+
{"step": 8900, "epoch": 0.5693449334698055, "timestamp": 1785722505.2752204, "loss": 3.034435844421387, "grad_norm": 0.7599353790283203, "learning_rate": 0.0003, "train/total_time_seconds": 879.1913787648082, "train/time_per_step_avg": 0.10004105973988771, "train/epoch_time_elapsed": 1543.0981552563608, "train/estimated_remaining_minutes": 1.8110683832233876}
|
| 908 |
+
{"step": 8910, "epoch": 0.5699846468781986, "timestamp": 1785722506.7665231, "loss": 3.044721221923828, "grad_norm": 0.7380226850509644, "learning_rate": 0.0003, "train/total_time_seconds": 880.1826359145343, "train/time_per_step_avg": 0.09856469772756099, "train/epoch_time_elapsed": 1544.5894583240151, "train/estimated_remaining_minutes": 1.7946110608807377}
|
| 909 |
+
{"step": 8920, "epoch": 0.5706243602865916, "timestamp": 1785722508.2374382, "loss": 3.0214120864868166, "grad_norm": 0.7559472322463989, "learning_rate": 0.0003, "train/total_time_seconds": 881.1703146360815, "train/time_per_step_avg": 0.09851975902915001, "train/epoch_time_elapsed": 1546.0603737160563, "train/estimated_remaining_minutes": 1.7781463748261737}
|
| 910 |
+
{"step": 8930, "epoch": 0.5712640736949847, "timestamp": 1785722509.6965747, "loss": 3.037161445617676, "grad_norm": 0.7356601357460022, "learning_rate": 0.0003, "train/total_time_seconds": 882.1526900008321, "train/time_per_step_avg": 0.09850762367248535, "train/epoch_time_elapsed": 1547.5195098854601, "train/estimated_remaining_minutes": 1.7616711054514564}
|
| 911 |
+
{"step": 8940, "epoch": 0.5719037871033776, "timestamp": 1785722511.1504614, "loss": 3.0833389282226564, "grad_norm": 0.7667426466941833, "learning_rate": 0.0003, "train/total_time_seconds": 883.1326379366219, "train/time_per_step_avg": 0.09847842566668988, "train/epoch_time_elapsed": 1548.9733966179192, "train/estimated_remaining_minutes": 1.7451912681074184}
|
| 912 |
+
{"step": 8950, "epoch": 0.5725435005117707, "timestamp": 1785722512.6073697, "loss": 3.0128894805908204, "grad_norm": 0.734130322933197, "learning_rate": 0.0003, "train/total_time_seconds": 884.1135435551405, "train/time_per_step_avg": 0.0984754029288888, "train/epoch_time_elapsed": 1550.4303051643074, "train/estimated_remaining_minutes": 1.7287136326497161}
|
| 913 |
+
{"step": 8960, "epoch": 0.5731832139201638, "timestamp": 1785722514.0658321, "loss": 3.047904396057129, "grad_norm": 0.7282822728157043, "learning_rate": 0.0003, "train/total_time_seconds": 885.0962597206235, "train/time_per_step_avg": 0.098406666778028, "train/epoch_time_elapsed": 1551.8887672759593, "train/estimated_remaining_minutes": 1.7122397881500158}
|
| 914 |
+
{"step": 8970, "epoch": 0.5738229273285568, "timestamp": 1785722515.5378659, "loss": 3.0162338256835937, "grad_norm": 0.7343953847885132, "learning_rate": 0.0003, "train/total_time_seconds": 886.0812903866172, "train/time_per_step_avg": 0.0984365589171648, "train/epoch_time_elapsed": 1553.3608015477657, "train/estimated_remaining_minutes": 1.6957705854667702}
|
| 915 |
+
{"step": 8980, "epoch": 0.5744626407369499, "timestamp": 1785722517.003947, "loss": 3.0476552963256838, "grad_norm": 0.7308396100997925, "learning_rate": 0.0003, "train/total_time_seconds": 887.0650000981987, "train/time_per_step_avg": 0.098434021435678, "train/epoch_time_elapsed": 1554.8268825672567, "train/estimated_remaining_minutes": 1.6792989979587278}
|
| 916 |
+
{"step": 8990, "epoch": 0.5751023541453428, "timestamp": 1785722518.4809961, "loss": 3.093793487548828, "grad_norm": 0.7416725754737854, "learning_rate": 0.0003, "train/total_time_seconds": 888.0501617640257, "train/time_per_step_avg": 0.09844682145863771, "train/epoch_time_elapsed": 1556.303931236267, "train/estimated_remaining_minutes": 1.6628302991873674}
|
| 917 |
+
{"step": 9000, "epoch": 0.5757420675537359, "timestamp": 1785722519.9436662, "loss": 3.0321537017822267, "grad_norm": 0.7449678182601929, "learning_rate": 0.0003, "train/total_time_seconds": 889.0335845015943, "train/time_per_step_avg": 0.09842205736786128, "train/epoch_time_elapsed": 1557.7666017077863, "train/estimated_remaining_minutes": 1.6463584898177672}
|
| 918 |
+
{"step": 9000, "epoch": 0.5757420675537359, "timestamp": 1785722533.3010812, "eval_loss": 1.5267232656478882, "eval_runtime": 13.3558, "eval_samples_per_second": 753.304, "eval_steps_per_second": 23.585, "train/total_time_seconds": 889.0335845015943, "train/time_per_step_avg": 0.09842205736786128, "train/epoch_time_elapsed": 1571.1240150555968, "train/estimated_remaining_minutes": 1.6463584898177672}
|
| 919 |
+
{"step": 9010, "epoch": 0.576381780962129, "timestamp": 1785722535.4341834, "loss": 3.051025390625, "grad_norm": 0.787919819355011, "learning_rate": 0.0003, "train/total_time_seconds": 890.1423236131668, "train/time_per_step_avg": 0.09959687698632479, "train/epoch_time_elapsed": 1573.2571186348796, "train/estimated_remaining_minutes": 1.6301163528986962}
|
| 920 |
+
{"step": 9020, "epoch": 0.577021494370522, "timestamp": 1785722536.8973336, "loss": 3.044897270202637, "grad_norm": 0.7309626340866089, "learning_rate": 0.0003, "train/total_time_seconds": 891.1249581798911, "train/time_per_step_avg": 0.09954643543809652, "train/epoch_time_elapsed": 1574.7202687002718, "train/estimated_remaining_minutes": 1.6136409072732691}
|
| 921 |
+
{"step": 9030, "epoch": 0.577661207778915, "timestamp": 1785722538.3726685, "loss": 3.0147327423095702, "grad_norm": 0.7239173650741577, "learning_rate": 0.0003, "train/total_time_seconds": 892.1097855567932, "train/time_per_step_avg": 0.09957095555961132, "train/epoch_time_elapsed": 1576.1956038288772, "train/estimated_remaining_minutes": 1.5971696050020108}
|
| 922 |
+
{"step": 9040, "epoch": 0.5783009211873081, "timestamp": 1785722539.8316612, "loss": 3.029562759399414, "grad_norm": 0.7224931120872498, "learning_rate": 0.0003, "train/total_time_seconds": 893.0914899110794, "train/time_per_step_avg": 0.09958851974457503, "train/epoch_time_elapsed": 1577.6545966081321, "train/estimated_remaining_minutes": 1.5806929024974856}
|
| 923 |
+
{"step": 9050, "epoch": 0.5789406345957011, "timestamp": 1785722541.2870882, "loss": 3.0619989395141602, "grad_norm": 0.6927824020385742, "learning_rate": 0.0003, "train/total_time_seconds": 894.0730178616941, "train/time_per_step_avg": 0.09959474306553602, "train/epoch_time_elapsed": 1579.1100234948099, "train/estimated_remaining_minutes": 1.56421614543022}
|
| 924 |
+
{"step": 9060, "epoch": 0.5795803480040942, "timestamp": 1785722542.7421756, "loss": 3.0587034225463867, "grad_norm": 0.7225214242935181, "learning_rate": 0.0003, "train/total_time_seconds": 895.0531932935119, "train/time_per_step_avg": 0.09956933572888374, "train/epoch_time_elapsed": 1580.5651106461883, "train/estimated_remaining_minutes": 1.5477373099630263}
|
| 925 |
+
{"step": 9070, "epoch": 0.5802200614124872, "timestamp": 1785722544.2000682, "loss": 3.040408134460449, "grad_norm": 0.7654429078102112, "learning_rate": 0.0003, "train/total_time_seconds": 896.0360477901995, "train/time_per_step_avg": 0.09954757403582334, "train/epoch_time_elapsed": 1582.0230034403503, "train/estimated_remaining_minutes": 1.5312633672269123}
|
| 926 |
+
{"step": 9080, "epoch": 0.5808597748208802, "timestamp": 1785722545.6611364, "loss": 3.0617746353149413, "grad_norm": 0.7328905463218689, "learning_rate": 0.0003, "train/total_time_seconds": 897.0198098421097, "train/time_per_step_avg": 0.09954809743911028, "train/epoch_time_elapsed": 1583.4840703867376, "train/estimated_remaining_minutes": 1.5147911619947518}
|
| 927 |
+
{"step": 9090, "epoch": 0.5814994882292733, "timestamp": 1785722547.1152966, "loss": 3.08687801361084, "grad_norm": 0.7585312128067017, "learning_rate": 0.0003, "train/total_time_seconds": 898.0005432590842, "train/time_per_step_avg": 0.09950381495058537, "train/epoch_time_elapsed": 1584.9382315725088, "train/estimated_remaining_minutes": 1.4983140710776799}
|
| 928 |
+
{"step": 9100, "epoch": 0.5821392016376663, "timestamp": 1785722548.5742278, "loss": 3.060943031311035, "grad_norm": 0.7539924383163452, "learning_rate": 0.0003, "train/total_time_seconds": 898.9846717007458, "train/time_per_step_avg": 0.09951087199151516, "train/epoch_time_elapsed": 1586.3971629180014, "train/estimated_remaining_minutes": 1.4818428654407898}
|
| 929 |
+
{"step": 9110, "epoch": 0.5827789150460594, "timestamp": 1785722550.042715, "loss": 3.0239376068115233, "grad_norm": 0.7278969883918762, "learning_rate": 0.0003, "train/total_time_seconds": 899.9704451672733, "train/time_per_step_avg": 0.09828121554106474, "train/epoch_time_elapsed": 1587.86565034464, "train/estimated_remaining_minutes": 1.465374489935736}
|
| 930 |
+
{"step": 9120, "epoch": 0.5834186284544524, "timestamp": 1785722551.5010736, "loss": 3.0415830612182617, "grad_norm": 0.7205769419670105, "learning_rate": 0.0003, "train/total_time_seconds": 900.9530432969332, "train/time_per_step_avg": 0.09828085117042065, "train/epoch_time_elapsed": 1589.3240088634193, "train/estimated_remaining_minutes": 1.4489010930213837}
|
| 931 |
+
{"step": 9130, "epoch": 0.5840583418628454, "timestamp": 1785722553.0045435, "loss": 2.991204261779785, "grad_norm": 0.7115036249160767, "learning_rate": 0.0003, "train/total_time_seconds": 901.9462278597057, "train/time_per_step_avg": 0.09836442302912474, "train/epoch_time_elapsed": 1590.8274790719151, "train/estimated_remaining_minutes": 1.4324447211353484}
|
| 932 |
+
{"step": 9140, "epoch": 0.5846980552712385, "timestamp": 1785722554.4887257, "loss": 3.067692184448242, "grad_norm": 0.7353113293647766, "learning_rate": 0.0003, "train/total_time_seconds": 902.9341435879469, "train/time_per_step_avg": 0.09842653676867485, "train/epoch_time_elapsed": 1592.3116613030434, "train/estimated_remaining_minutes": 1.4159798750649786}
|
| 933 |
+
{"step": 9150, "epoch": 0.5853377686796315, "timestamp": 1785722555.9568818, "loss": 3.0349430084228515, "grad_norm": 0.7365278005599976, "learning_rate": 0.0003, "train/total_time_seconds": 903.9215594902635, "train/time_per_step_avg": 0.09848541628569364, "train/epoch_time_elapsed": 1593.7798165977001, "train/estimated_remaining_minutes": 1.399514254219898}
|
| 934 |
+
{"step": 9160, "epoch": 0.5859774820880246, "timestamp": 1785722557.4186938, "loss": 3.017600250244141, "grad_norm": 0.7234794497489929, "learning_rate": 0.0003, "train/total_time_seconds": 904.9045335836709, "train/time_per_step_avg": 0.09851340290158987, "train/epoch_time_elapsed": 1595.2416292764246, "train/estimated_remaining_minutes": 1.3830418635558286}
|
| 935 |
+
{"step": 9170, "epoch": 0.5866171954964176, "timestamp": 1785722558.8778603, "loss": 3.014165496826172, "grad_norm": 0.7221100330352783, "learning_rate": 0.0003, "train/total_time_seconds": 905.8867691531777, "train/time_per_step_avg": 0.0985072136297822, "train/epoch_time_elapsed": 1596.7007951885462, "train/estimated_remaining_minutes": 1.366568553975168}
|
| 936 |
+
{"step": 9180, "epoch": 0.5872569089048106, "timestamp": 1785722560.335649, "loss": 3.0203433990478517, "grad_norm": 0.7074626088142395, "learning_rate": 0.0003, "train/total_time_seconds": 906.869181342423, "train/time_per_step_avg": 0.09849371500313282, "train/epoch_time_elapsed": 1598.1585838906467, "train/estimated_remaining_minutes": 1.3500957311198019}
|
| 937 |
+
{"step": 9190, "epoch": 0.5878966223132037, "timestamp": 1785722561.8109732, "loss": 3.0427619934082033, "grad_norm": 0.7351915240287781, "learning_rate": 0.0003, "train/total_time_seconds": 907.8586116507649, "train/time_per_step_avg": 0.09858068391680717, "train/epoch_time_elapsed": 1599.6339059211314, "train/estimated_remaining_minutes": 1.3336334338721791}
|
| 938 |
+
{"step": 9200, "epoch": 0.5885363357215967, "timestamp": 1785722563.2965007, "loss": 3.0233144760131836, "grad_norm": 0.7336395382881165, "learning_rate": 0.0003, "train/total_time_seconds": 908.8487447723746, "train/time_per_step_avg": 0.0986407307162881, "train/epoch_time_elapsed": 1601.1194360814989, "train/estimated_remaining_minutes": 1.317172093873007}
|
| 939 |
+
{"step": 9210, "epoch": 0.5891760491299898, "timestamp": 1785722564.914234, "loss": 3.0559221267700196, "grad_norm": 0.8395518660545349, "learning_rate": 0.0003, "train/total_time_seconds": 909.9681367278099, "train/time_per_step_avg": 0.09997691560536623, "train/epoch_time_elapsed": 1602.7371687106788, "train/estimated_remaining_minutes": 1.3008954542435212}
|
| 940 |
+
{"step": 9220, "epoch": 0.5898157625383829, "timestamp": 1785722566.373442, "loss": 3.0081340789794924, "grad_norm": 0.7505086064338684, "learning_rate": 0.0003, "train/total_time_seconds": 910.951234985143, "train/time_per_step_avg": 0.09998191688209772, "train/epoch_time_elapsed": 1604.1963778212667, "train/estimated_remaining_minutes": 1.2844214809985746}
|
| 941 |
+
{"step": 9230, "epoch": 0.5904554759467758, "timestamp": 1785722567.8361633, "loss": 3.0191484451293946, "grad_norm": 0.7214183211326599, "learning_rate": 0.0003, "train/total_time_seconds": 911.9344468340278, "train/time_per_step_avg": 0.0998821897432208, "train/epoch_time_elapsed": 1605.6590987369418, "train/estimated_remaining_minutes": 1.2679478585449646}
|
| 942 |
+
{"step": 9240, "epoch": 0.5910951893551689, "timestamp": 1785722569.3002367, "loss": 2.992063522338867, "grad_norm": 0.7177115678787231, "learning_rate": 0.0003, "train/total_time_seconds": 912.9181185811758, "train/time_per_step_avg": 0.09983974993228913, "train/epoch_time_elapsed": 1607.123171724379, "train/estimated_remaining_minutes": 1.2514750543320592}
|
| 943 |
+
{"step": 9250, "epoch": 0.5917349027635619, "timestamp": 1785722570.7559288, "loss": 2.9887811660766603, "grad_norm": 0.6912328004837036, "learning_rate": 0.0003, "train/total_time_seconds": 913.8989926576614, "train/time_per_step_avg": 0.09977433167397975, "train/epoch_time_elapsed": 1608.578864004463, "train/estimated_remaining_minutes": 1.2349986387265695}
|
| 944 |
+
{"step": 9260, "epoch": 0.592374616171955, "timestamp": 1785722572.2124822, "loss": 3.008378601074219, "grad_norm": 0.7259435057640076, "learning_rate": 0.0003, "train/total_time_seconds": 914.8794209584594, "train/time_per_step_avg": 0.09974887374788523, "train/epoch_time_elapsed": 1610.035417933017, "train/estimated_remaining_minutes": 1.2185219069641107}
|
| 945 |
+
{"step": 9270, "epoch": 0.593014329580348, "timestamp": 1785722573.6646986, "loss": 3.033091926574707, "grad_norm": 0.7467559576034546, "learning_rate": 0.0003, "train/total_time_seconds": 915.8590813055634, "train/time_per_step_avg": 0.09972312152385712, "train/epoch_time_elapsed": 1611.487634126097, "train/estimated_remaining_minutes": 1.2020444612604484}
|
| 946 |
+
{"step": 9280, "epoch": 0.593654042988741, "timestamp": 1785722575.1241999, "loss": 3.025362014770508, "grad_norm": 0.7338125705718994, "learning_rate": 0.0003, "train/total_time_seconds": 916.8418307974935, "train/time_per_step_avg": 0.09972649455070495, "train/epoch_time_elapsed": 1612.9471353255212, "train/estimated_remaining_minutes": 1.1855713329277933}
|
| 947 |
+
{"step": 9290, "epoch": 0.5942937563971341, "timestamp": 1785722576.5804214, "loss": 3.021139717102051, "grad_norm": 0.7096598148345947, "learning_rate": 0.0003, "train/total_time_seconds": 917.8235721550882, "train/time_per_step_avg": 0.09964960504323245, "train/epoch_time_elapsed": 1614.4033567234874, "train/estimated_remaining_minutes": 1.1690971227666176}
|
| 948 |
+
{"step": 9300, "epoch": 0.5949334698055271, "timestamp": 1785722578.038835, "loss": 3.025838088989258, "grad_norm": 0.7540204524993896, "learning_rate": 0.0003, "train/total_time_seconds": 918.8082187026739, "train/time_per_step_avg": 0.09959473930299283, "train/epoch_time_elapsed": 1615.8617700859904, "train/estimated_remaining_minutes": 1.152626797655684}
|
| 949 |
+
{"step": 9310, "epoch": 0.5955731832139202, "timestamp": 1785722579.4898448, "loss": 3.0594036102294924, "grad_norm": 0.7397232055664062, "learning_rate": 0.0003, "train/total_time_seconds": 919.7866587638855, "train/time_per_step_avg": 0.09818522036075591, "train/epoch_time_elapsed": 1617.312779802829, "train/estimated_remaining_minutes": 1.1361489340262818}
|
| 950 |
+
{"step": 9320, "epoch": 0.5962128966223132, "timestamp": 1785722580.961043, "loss": 3.048040008544922, "grad_norm": 0.7410675883293152, "learning_rate": 0.0003, "train/total_time_seconds": 920.7684038281441, "train/time_per_step_avg": 0.09817168843001127, "train/epoch_time_elapsed": 1618.7839770130813, "train/estimated_remaining_minutes": 1.1196754552988877}
|
| 951 |
+
{"step": 9330, "epoch": 0.5968526100307062, "timestamp": 1785722582.4350803, "loss": 3.017748260498047, "grad_norm": 0.7509797215461731, "learning_rate": 0.0003, "train/total_time_seconds": 921.7570914514363, "train/time_per_step_avg": 0.09822644617408514, "train/epoch_time_elapsed": 1620.2580150030553, "train/estimated_remaining_minutes": 1.1032105238879284}
|
| 952 |
+
{"step": 9340, "epoch": 0.5974923234390993, "timestamp": 1785722583.971526, "loss": 3.0299427032470705, "grad_norm": 0.7366655468940735, "learning_rate": 0.0003, "train/total_time_seconds": 922.7497477047145, "train/time_per_step_avg": 0.09831629123538732, "train/epoch_time_elapsed": 1621.7944608964026, "train/estimated_remaining_minutes": 1.0867502381961307}
|
| 953 |
+
{"step": 9350, "epoch": 0.5981320368474923, "timestamp": 1785722585.4588904, "loss": 3.023137855529785, "grad_norm": 0.7200518250465393, "learning_rate": 0.0003, "train/total_time_seconds": 923.7416116781533, "train/time_per_step_avg": 0.09842619020491838, "train/epoch_time_elapsed": 1623.2818254120648, "train/estimated_remaining_minutes": 1.070288854885561}
|
| 954 |
+
{"step": 9360, "epoch": 0.5987717502558854, "timestamp": 1785722586.9281318, "loss": 3.042491149902344, "grad_norm": 0.7337636351585388, "learning_rate": 0.0003, "train/total_time_seconds": 924.7253942452371, "train/time_per_step_avg": 0.09845973286777734, "train/epoch_time_elapsed": 1624.751066673547, "train/estimated_remaining_minutes": 1.0538181130999853}
|
| 955 |
+
{"step": 9370, "epoch": 0.5994114636642784, "timestamp": 1785722588.3834362, "loss": 3.003479766845703, "grad_norm": 0.7155030965805054, "learning_rate": 0.0003, "train/total_time_seconds": 925.7086359262466, "train/time_per_step_avg": 0.09849554620683193, "train/epoch_time_elapsed": 1626.2063715346158, "train/estimated_remaining_minutes": 1.037346923930159}
|
| 956 |
+
{"step": 9380, "epoch": 0.6000511770726714, "timestamp": 1785722589.8396435, "loss": 3.005526542663574, "grad_norm": 0.6959989666938782, "learning_rate": 0.0003, "train/total_time_seconds": 926.687703486532, "train/time_per_step_avg": 0.09845872689038515, "train/epoch_time_elapsed": 1627.662578780204, "train/estimated_remaining_minutes": 1.0208713151415243}
|
| 957 |
+
{"step": 9390, "epoch": 0.6006908904810645, "timestamp": 1785722591.289475, "loss": 3.0247573852539062, "grad_norm": 0.711842954158783, "learning_rate": 0.0003, "train/total_time_seconds": 927.665627732873, "train/time_per_step_avg": 0.09842055577784777, "train/epoch_time_elapsed": 1629.1124103739858, "train/estimated_remaining_minutes": 1.0043948046096067}
|
| 958 |
+
{"step": 9400, "epoch": 0.6013306038894575, "timestamp": 1785722592.7515337, "loss": 3.0091373443603517, "grad_norm": 0.7486410140991211, "learning_rate": 0.0003, "train/total_time_seconds": 928.6502978131175, "train/time_per_step_avg": 0.09842079110443593, "train/epoch_time_elapsed": 1630.5744689404964, "train/estimated_remaining_minutes": 0.987925848737359}
|
| 959 |
+
{"step": 9410, "epoch": 0.6019703172978506, "timestamp": 1785722594.36439, "loss": 3.04836368560791, "grad_norm": 0.7371384501457214, "learning_rate": 0.0003, "train/total_time_seconds": 929.7620632834733, "train/time_per_step_avg": 0.09975404519587755, "train/epoch_time_elapsed": 1632.187325309962, "train/estimated_remaining_minutes": 0.9715898287942778}
|
| 960 |
+
{"step": 9420, "epoch": 0.6026100307062436, "timestamp": 1785722595.8815506, "loss": 3.032833290100098, "grad_norm": 0.7353297472000122, "learning_rate": 0.0003, "train/total_time_seconds": 930.7631437554955, "train/time_per_step_avg": 0.09994739927351474, "train/epoch_time_elapsed": 1633.7044854946434, "train/estimated_remaining_minutes": 0.9551355686096734}
|
| 961 |
+
{"step": 9430, "epoch": 0.6032497441146366, "timestamp": 1785722597.3367267, "loss": 3.0058853149414064, "grad_norm": 0.7800153493881226, "learning_rate": 0.0003, "train/total_time_seconds": 931.7456391714513, "train/time_per_step_avg": 0.0998854772001505, "train/epoch_time_elapsed": 1635.1596616022289, "train/estimated_remaining_minutes": 0.9386620967262764}
|
| 962 |
+
{"step": 9440, "epoch": 0.6038894575230297, "timestamp": 1785722598.7910163, "loss": 3.0878820419311523, "grad_norm": 0.709791898727417, "learning_rate": 0.0003, "train/total_time_seconds": 932.7257401272655, "train/time_per_step_avg": 0.09975992422550917, "train/epoch_time_elapsed": 1636.6139515452087, "train/estimated_remaining_minutes": 0.9221864662275223}
|
| 963 |
+
{"step": 9450, "epoch": 0.6045291709314228, "timestamp": 1785722600.238383, "loss": 3.0879669189453125, "grad_norm": 0.7300289869308472, "learning_rate": 0.0003, "train/total_time_seconds": 933.6985915228724, "train/time_per_step_avg": 0.09956979844719172, "train/epoch_time_elapsed": 1638.0613184794784, "train/estimated_remaining_minutes": 0.9057041011244795}
|
| 964 |
+
{"step": 9460, "epoch": 0.6051688843398157, "timestamp": 1785722601.693933, "loss": 3.0317686080932615, "grad_norm": 0.7477501034736633, "learning_rate": 0.0003, "train/total_time_seconds": 934.6756386868656, "train/time_per_step_avg": 0.09950244441628456, "train/epoch_time_elapsed": 1639.5168681517243, "train/estimated_remaining_minutes": 0.8892262947338044}
|
| 965 |
+
{"step": 9470, "epoch": 0.6058085977482088, "timestamp": 1785722603.1419885, "loss": 2.9963333129882814, "grad_norm": 0.7183599472045898, "learning_rate": 0.0003, "train/total_time_seconds": 935.652399815619, "train/time_per_step_avg": 0.09943763889372349, "train/epoch_time_elapsed": 1640.9649239331484, "train/estimated_remaining_minutes": 0.8727486305918305}
|
| 966 |
+
{"step": 9480, "epoch": 0.6064483111566018, "timestamp": 1785722604.5923235, "loss": 2.9687015533447267, "grad_norm": 0.7152074575424194, "learning_rate": 0.0003, "train/total_time_seconds": 936.6281616948545, "train/time_per_step_avg": 0.09940458208322525, "train/epoch_time_elapsed": 1642.4152588248253, "train/estimated_remaining_minutes": 0.8562704713103452}
|
| 967 |
+
{"step": 9490, "epoch": 0.6070880245649949, "timestamp": 1785722606.043398, "loss": 2.9663999557495115, "grad_norm": 0.7170935273170471, "learning_rate": 0.0003, "train/total_time_seconds": 937.6077852584422, "train/time_per_step_avg": 0.09942157525569201, "train/epoch_time_elapsed": 1643.8663330860436, "train/estimated_remaining_minutes": 0.8397962249417027}
|
| 968 |
+
{"step": 9500, "epoch": 0.607727737973388, "timestamp": 1785722607.500508, "loss": 3.0422943115234373, "grad_norm": 0.7210248708724976, "learning_rate": 0.0003, "train/total_time_seconds": 938.5864450372756, "train/time_per_step_avg": 0.09936147224158048, "train/epoch_time_elapsed": 1645.3234434612095, "train/estimated_remaining_minutes": 0.823321443015154}
|
| 969 |
+
{"step": 9500, "epoch": 0.607727737973388, "timestamp": 1785722620.6153033, "eval_loss": 1.5187240839004517, "eval_runtime": 13.1134, "eval_samples_per_second": 767.23, "eval_steps_per_second": 24.021, "train/total_time_seconds": 938.5864450372756, "train/time_per_step_avg": 0.09936147224158048, "train/epoch_time_elapsed": 1658.438237093389, "train/estimated_remaining_minutes": 0.823321443015154}
|
| 970 |
+
{"step": 9510, "epoch": 0.6083674513817809, "timestamp": 1785722622.0660324, "loss": 3.0485095977783203, "grad_norm": 0.7345911860466003, "learning_rate": 0.0003, "train/total_time_seconds": 939.5632178448141, "train/time_per_step_avg": 0.0980115456134081, "train/epoch_time_elapsed": 1659.8889675065875, "train/estimated_remaining_minutes": 0.806845385110338}
|
| 971 |
+
{"step": 9520, "epoch": 0.609007164790174, "timestamp": 1785722623.547675, "loss": 3.02121524810791, "grad_norm": 0.7562483549118042, "learning_rate": 0.0003, "train/total_time_seconds": 940.5426817834377, "train/time_per_step_avg": 0.0977953802794218, "train/epoch_time_elapsed": 1661.370610281825, "train/estimated_remaining_minutes": 0.7903720014986871}
|
| 972 |
+
{"step": 9530, "epoch": 0.609646878198567, "timestamp": 1785722625.0173287, "loss": 3.0314985275268556, "grad_norm": 0.7113906145095825, "learning_rate": 0.0003, "train/total_time_seconds": 941.5352716632187, "train/time_per_step_avg": 0.09789632491767407, "train/epoch_time_elapsed": 1662.8402636684477, "train/estimated_remaining_minutes": 0.7739097196252409}
|
| 973 |
+
{"step": 9540, "epoch": 0.6102865916069601, "timestamp": 1785722626.4643414, "loss": 3.0462518692016602, "grad_norm": 0.7356107234954834, "learning_rate": 0.0003, "train/total_time_seconds": 942.511011172086, "train/time_per_step_avg": 0.09785271044820547, "train/epoch_time_elapsed": 1664.2872770056129, "train/estimated_remaining_minutes": 0.7574337266582103}
|
| 974 |
+
{"step": 9550, "epoch": 0.6109263050153532, "timestamp": 1785722627.9088142, "loss": 3.034453773498535, "grad_norm": 0.7405982613563538, "learning_rate": 0.0003, "train/total_time_seconds": 943.4851300157607, "train/time_per_step_avg": 0.09786538492888212, "train/epoch_time_elapsed": 1665.7317488603294, "train/estimated_remaining_minutes": 0.7409569083893409}
|
| 975 |
+
{"step": 9560, "epoch": 0.6115660184237461, "timestamp": 1785722629.3518891, "loss": 3.070840263366699, "grad_norm": 0.7343717813491821, "learning_rate": 0.0003, "train/total_time_seconds": 944.4582480750978, "train/time_per_step_avg": 0.09782609388232232, "train/epoch_time_elapsed": 1667.1748244315386, "train/estimated_remaining_minutes": 0.7244798276726692}
|
| 976 |
+
{"step": 9570, "epoch": 0.6122057318321392, "timestamp": 1785722630.7916493, "loss": 3.0211687088012695, "grad_norm": 0.7719387412071228, "learning_rate": 0.0003, "train/total_time_seconds": 945.428681217134, "train/time_per_step_avg": 0.09776281401515007, "train/epoch_time_elapsed": 1668.6145845800638, "train/estimated_remaining_minutes": 0.7080012764252309}
|
| 977 |
+
{"step": 9580, "epoch": 0.6128454452405322, "timestamp": 1785722632.230563, "loss": 2.9816259384155273, "grad_norm": 0.7366647124290466, "learning_rate": 0.0003, "train/total_time_seconds": 946.3973135687411, "train/time_per_step_avg": 0.09769151873886585, "train/epoch_time_elapsed": 1670.0534978993237, "train/estimated_remaining_minutes": 0.6915220454051344}
|
| 978 |
+
{"step": 9590, "epoch": 0.6134851586489253, "timestamp": 1785722633.687046, "loss": 3.0112916946411135, "grad_norm": 0.7294787764549255, "learning_rate": 0.0003, "train/total_time_seconds": 947.3732487894595, "train/time_per_step_avg": 0.09765463531017303, "train/epoch_time_elapsed": 1671.5099813193083, "train/estimated_remaining_minutes": 0.6750487174203655}
|
| 979 |
+
{"step": 9600, "epoch": 0.6141248720573184, "timestamp": 1785722635.1380525, "loss": 3.0420854568481444, "grad_norm": 0.7358689904212952, "learning_rate": 0.0003, "train/total_time_seconds": 948.3483910933137, "train/time_per_step_avg": 0.09761946056038141, "train/epoch_time_elapsed": 1672.9609874598682, "train/estimated_remaining_minutes": 0.6585752715925789}
|
| 980 |
+
{"step": 9610, "epoch": 0.6147645854657113, "timestamp": 1785722636.712863, "loss": 3.063229560852051, "grad_norm": 0.7284457683563232, "learning_rate": 0.0003, "train/total_time_seconds": 949.4375238120556, "train/time_per_step_avg": 0.09874305967241526, "train/epoch_time_elapsed": 1674.5357980690897, "train/estimated_remaining_minutes": 0.6421793865534194}
|
| 981 |
+
{"step": 9620, "epoch": 0.6154042988741044, "timestamp": 1785722638.159128, "loss": 3.011884307861328, "grad_norm": 0.736709713935852, "learning_rate": 0.0003, "train/total_time_seconds": 950.4097154699266, "train/time_per_step_avg": 0.09867033686488867, "train/epoch_time_elapsed": 1675.9820632487535, "train/estimated_remaining_minutes": 0.625702861882488}
|
| 982 |
+
{"step": 9630, "epoch": 0.6160440122824974, "timestamp": 1785722639.598156, "loss": 3.0493335723876953, "grad_norm": 0.7053621411323547, "learning_rate": 0.0003, "train/total_time_seconds": 951.3817293271422, "train/time_per_step_avg": 0.09846457663923502, "train/epoch_time_elapsed": 1677.4210913330317, "train/estimated_remaining_minutes": 0.6092267910194576}
|
| 983 |
+
{"step": 9640, "epoch": 0.6166837256908905, "timestamp": 1785722641.0345852, "loss": 2.9985368728637694, "grad_norm": 0.7389722466468811, "learning_rate": 0.0003, "train/total_time_seconds": 952.3513216786087, "train/time_per_step_avg": 0.09840310506522655, "train/epoch_time_elapsed": 1678.8575206138194, "train/estimated_remaining_minutes": 0.5927497852771424}
|
| 984 |
+
{"step": 9650, "epoch": 0.6173234390992836, "timestamp": 1785722642.4782472, "loss": 3.0160663604736326, "grad_norm": 0.7137466669082642, "learning_rate": 0.0003, "train/total_time_seconds": 953.3272574022412, "train/time_per_step_avg": 0.0984212738648057, "train/epoch_time_elapsed": 1680.3011812642217, "train/estimated_remaining_minutes": 0.5762772713139628}
|
| 985 |
+
{"step": 9660, "epoch": 0.6179631525076765, "timestamp": 1785722643.9695454, "loss": 3.001752471923828, "grad_norm": 0.7166724801063538, "learning_rate": 0.0003, "train/total_time_seconds": 954.3265836313367, "train/time_per_step_avg": 0.0986833555623889, "train/epoch_time_elapsed": 1681.7924807481468, "train/estimated_remaining_minutes": 0.5598189068920885}
|
| 986 |
+
{"step": 9670, "epoch": 0.6186028659160696, "timestamp": 1785722645.4319296, "loss": 3.037667083740234, "grad_norm": 0.7562233209609985, "learning_rate": 0.0003, "train/total_time_seconds": 955.3089382275939, "train/time_per_step_avg": 0.098802570104599, "train/epoch_time_elapsed": 1683.2548647969961, "train/estimated_remaining_minutes": 0.543350481928828}
|
| 987 |
+
{"step": 9680, "epoch": 0.6192425793244627, "timestamp": 1785722646.899362, "loss": 2.961943817138672, "grad_norm": 0.7265304923057556, "learning_rate": 0.0003, "train/total_time_seconds": 956.2927057370543, "train/time_per_step_avg": 0.09895392168313265, "train/epoch_time_elapsed": 1684.7222973406315, "train/estimated_remaining_minutes": 0.5268830334639418}
|
| 988 |
+
{"step": 9690, "epoch": 0.6198822927328557, "timestamp": 1785722648.3762352, "loss": 3.040861701965332, "grad_norm": 0.7128055691719055, "learning_rate": 0.0003, "train/total_time_seconds": 957.2761979363859, "train/time_per_step_avg": 0.09902949146926403, "train/epoch_time_elapsed": 1686.1991705186665, "train/estimated_remaining_minutes": 0.5104155854149977}
|
| 989 |
+
{"step": 9700, "epoch": 0.6205220061412487, "timestamp": 1785722649.8362153, "loss": 3.0317344665527344, "grad_norm": 0.7139215469360352, "learning_rate": 0.0003, "train/total_time_seconds": 958.2572982609272, "train/time_per_step_avg": 0.09908907167613507, "train/epoch_time_elapsed": 1687.6591504588723, "train/estimated_remaining_minutes": 0.49394706095924085}
|
| 990 |
+
{"step": 9710, "epoch": 0.6211617195496417, "timestamp": 1785722651.2962189, "loss": 3.048139190673828, "grad_norm": 0.772463858127594, "learning_rate": 0.0003, "train/total_time_seconds": 959.2406228333712, "train/time_per_step_avg": 0.09803099021315574, "train/epoch_time_elapsed": 1689.119153790176, "train/estimated_remaining_minutes": 0.4774798843489146}
|
| 991 |
+
{"step": 9720, "epoch": 0.6218014329580348, "timestamp": 1785722652.7537234, "loss": 3.030372428894043, "grad_norm": 0.7049617767333984, "learning_rate": 0.0003, "train/total_time_seconds": 960.2207293584943, "train/time_per_step_avg": 0.09811013888567686, "train/epoch_time_elapsed": 1690.5766586773098, "train/estimated_remaining_minutes": 0.46101132410901646}
|
| 992 |
+
{"step": 9730, "epoch": 0.6224411463664279, "timestamp": 1785722654.219257, "loss": 3.072884750366211, "grad_norm": 0.6883598566055298, "learning_rate": 0.0003, "train/total_time_seconds": 961.2049737796187, "train/time_per_step_avg": 0.09823244452476501, "train/epoch_time_elapsed": 1692.0421925894916, "train/estimated_remaining_minutes": 0.44454495190218746}
|
| 993 |
+
{"step": 9740, "epoch": 0.6230808597748209, "timestamp": 1785722655.703091, "loss": 3.0640806198120116, "grad_norm": 0.7558647990226746, "learning_rate": 0.0003, "train/total_time_seconds": 962.2098557688296, "train/time_per_step_avg": 0.09858534090220929, "train/epoch_time_elapsed": 1693.5260263569653, "train/estimated_remaining_minutes": 0.42808788928798036}
|
| 994 |
+
{"step": 9750, "epoch": 0.6237205731832139, "timestamp": 1785722657.1540256, "loss": 3.027547264099121, "grad_norm": 0.7495359182357788, "learning_rate": 0.0003, "train/total_time_seconds": 963.1870792098343, "train/time_per_step_avg": 0.09859821807593107, "train/epoch_time_elapsed": 1694.976960554719, "train/estimated_remaining_minutes": 0.4116184099187326}
|
| 995 |
+
{"step": 9760, "epoch": 0.6243602865916069, "timestamp": 1785722658.6046157, "loss": 2.995998001098633, "grad_norm": 0.7255857586860657, "learning_rate": 0.0003, "train/total_time_seconds": 964.1641744635999, "train/time_per_step_avg": 0.09837590832263231, "train/epoch_time_elapsed": 1696.4275510422885, "train/estimated_remaining_minutes": 0.39514925182934424}
|
| 996 |
+
{"step": 9770, "epoch": 0.625, "timestamp": 1785722660.0587292, "loss": 3.057126998901367, "grad_norm": 0.7283080220222473, "learning_rate": 0.0003, "train/total_time_seconds": 965.1436297111213, "train/time_per_step_avg": 0.09834691483527422, "train/epoch_time_elapsed": 1697.8816646821797, "train/estimated_remaining_minutes": 0.37868139685015}
|
| 997 |
+
{"step": 9780, "epoch": 0.6256397134083931, "timestamp": 1785722661.5091515, "loss": 2.9865432739257813, "grad_norm": 0.7030864953994751, "learning_rate": 0.0003, "train/total_time_seconds": 966.1216058209538, "train/time_per_step_avg": 0.09828900083899499, "train/epoch_time_elapsed": 1699.3320865519345, "train/estimated_remaining_minutes": 0.36221328098263433}
|
| 998 |
+
{"step": 9790, "epoch": 0.6262794268167861, "timestamp": 1785722662.9556434, "loss": 3.0120601654052734, "grad_norm": 0.7367250919342041, "learning_rate": 0.0003, "train/total_time_seconds": 967.0969621241093, "train/time_per_step_avg": 0.09820764187723398, "train/epoch_time_elapsed": 1700.7785790115595, "train/estimated_remaining_minutes": 0.3457445727716427}
|
| 999 |
+
{"step": 9800, "epoch": 0.6269191402251791, "timestamp": 1785722664.4045553, "loss": 3.0178157806396486, "grad_norm": 0.7107921838760376, "learning_rate": 0.0003, "train/total_time_seconds": 968.0725956857204, "train/time_per_step_avg": 0.09815297424793243, "train/epoch_time_elapsed": 1702.2274907566607, "train/estimated_remaining_minutes": 0.3292763930903811}
|
| 1000 |
+
{"step": 9810, "epoch": 0.6275588536335721, "timestamp": 1785722665.989123, "loss": 3.0228038787841798, "grad_norm": 0.738336980342865, "learning_rate": 0.0003, "train/total_time_seconds": 969.1678158640862, "train/time_per_step_avg": 0.09927193030714988, "train/epoch_time_elapsed": 1703.8120580427349, "train/estimated_remaining_minutes": 0.3128472392357737}
|
| 1001 |
+
{"step": 9820, "epoch": 0.6281985670419652, "timestamp": 1785722667.4409938, "loss": 3.014809989929199, "grad_norm": 0.7248766422271729, "learning_rate": 0.0003, "train/total_time_seconds": 970.1459771618247, "train/time_per_step_avg": 0.09925247803330421, "train/epoch_time_elapsed": 1705.2639287896454, "train/estimated_remaining_minutes": 0.2963786080942438}
|
| 1002 |
+
{"step": 9830, "epoch": 0.6288382804503583, "timestamp": 1785722668.8947237, "loss": 3.0531681060791014, "grad_norm": 0.716881513595581, "learning_rate": 0.0003, "train/total_time_seconds": 971.1259725056589, "train/time_per_step_avg": 0.09920998726040126, "train/epoch_time_elapsed": 1706.7176589891315, "train/estimated_remaining_minutes": 0.27991084321119364}
|
| 1003 |
+
{"step": 9840, "epoch": 0.6294779938587513, "timestamp": 1785722670.3467739, "loss": 3.066875457763672, "grad_norm": 0.6840282082557678, "learning_rate": 0.0003, "train/total_time_seconds": 972.1042066887021, "train/time_per_step_avg": 0.09894350919872523, "train/epoch_time_elapsed": 1708.1697087809443, "train/estimated_remaining_minutes": 0.2634428744413827}
|
| 1004 |
+
{"step": 9850, "epoch": 0.6301177072671443, "timestamp": 1785722671.80069, "loss": 3.008139991760254, "grad_norm": 0.7254654169082642, "learning_rate": 0.0003, "train/total_time_seconds": 973.084804084152, "train/time_per_step_avg": 0.09897724874317645, "train/epoch_time_elapsed": 1709.6236249767244, "train/estimated_remaining_minutes": 0.24697583860003858}
|
| 1005 |
+
{"step": 9860, "epoch": 0.6307574206755373, "timestamp": 1785722673.2523458, "loss": 3.003853416442871, "grad_norm": 0.758415937423706, "learning_rate": 0.0003, "train/total_time_seconds": 974.0641218498349, "train/time_per_step_avg": 0.09899947386234999, "train/epoch_time_elapsed": 1711.075281381607, "train/estimated_remaining_minutes": 0.23050875094485612}
|
| 1006 |
+
{"step": 9870, "epoch": 0.6313971340839304, "timestamp": 1785722674.7482953, "loss": 3.104911231994629, "grad_norm": 0.7402628660202026, "learning_rate": 0.0003, "train/total_time_seconds": 975.047211907804, "train/time_per_step_avg": 0.09903582196682692, "train/epoch_time_elapsed": 1712.571230813861, "train/estimated_remaining_minutes": 0.2140427854576402}
|
| 1007 |
+
{"step": 9880, "epoch": 0.6320368474923235, "timestamp": 1785722676.2313838, "loss": 3.0169857025146483, "grad_norm": 0.7082782983779907, "learning_rate": 0.0003, "train/total_time_seconds": 976.0249982997775, "train/time_per_step_avg": 0.09903392478823662, "train/epoch_time_elapsed": 1714.0543192699552, "train/estimated_remaining_minutes": 0.1975759105869995}
|
| 1008 |
+
{"step": 9890, "epoch": 0.6326765609007164, "timestamp": 1785722677.6987233, "loss": 2.9872085571289064, "grad_norm": 0.7640434503555298, "learning_rate": 0.0003, "train/total_time_seconds": 977.0078327059746, "train/time_per_step_avg": 0.09910870581865311, "train/epoch_time_elapsed": 1715.5216585844755, "train/estimated_remaining_minutes": 0.18111031614030537}
|
| 1009 |
+
{"step": 9900, "epoch": 0.6333162743091095, "timestamp": 1785722679.1614962, "loss": 2.9868215560913085, "grad_norm": 0.7348747253417969, "learning_rate": 0.0003, "train/total_time_seconds": 977.9858025461435, "train/time_per_step_avg": 0.09913206860423088, "train/epoch_time_elapsed": 1716.9844311885536, "train/estimated_remaining_minutes": 0.16464407450271776}
|
| 1010 |
+
{"step": 9910, "epoch": 0.6339559877175026, "timestamp": 1785722680.6095927, "loss": 2.9935914993286135, "grad_norm": 0.7069410085678101, "learning_rate": 0.0003, "train/total_time_seconds": 978.9616319090128, "train/time_per_step_avg": 0.09793816044926644, "train/epoch_time_elapsed": 1718.4325275681913, "train/estimated_remaining_minutes": 0.14817784539490608}
|
| 1011 |
+
{"step": 9920, "epoch": 0.6345957011258956, "timestamp": 1785722682.0652163, "loss": 2.9828176498413086, "grad_norm": 0.7610164284706116, "learning_rate": 0.0003, "train/total_time_seconds": 979.9419849961996, "train/time_per_step_avg": 0.09796007834374905, "train/epoch_time_elapsed": 1719.888151627034, "train/estimated_remaining_minutes": 0.13171263239196232}
|
| 1012 |
+
{"step": 9930, "epoch": 0.6352354145342887, "timestamp": 1785722683.519883, "loss": 3.0850605010986327, "grad_norm": 0.7017394304275513, "learning_rate": 0.0003, "train/total_time_seconds": 980.9207451269031, "train/time_per_step_avg": 0.09794772621244192, "train/epoch_time_elapsed": 1721.3428182192147, "train/estimated_remaining_minutes": 0.11524748600013966}
|
| 1013 |
+
{"step": 9940, "epoch": 0.6358751279426816, "timestamp": 1785722685.0366778, "loss": 2.980435371398926, "grad_norm": 0.7175168991088867, "learning_rate": 0.0003, "train/total_time_seconds": 981.9242913536727, "train/time_per_step_avg": 0.09820084664970637, "train/epoch_time_elapsed": 1722.8596131391823, "train/estimated_remaining_minutes": 0.09878513997521858}
|
| 1014 |
+
{"step": 9950, "epoch": 0.6365148413510747, "timestamp": 1785722686.4911203, "loss": 3.047547149658203, "grad_norm": 0.732683539390564, "learning_rate": 0.0003, "train/total_time_seconds": 982.9027289673686, "train/time_per_step_avg": 0.0981792488321662, "train/epoch_time_elapsed": 1724.3140556029975, "train/estimated_remaining_minutes": 0.08232016155505599}
|
| 1015 |
+
{"step": 9960, "epoch": 0.6371545547594678, "timestamp": 1785722687.9504044, "loss": 3.0357919692993165, "grad_norm": 0.698196530342102, "learning_rate": 0.0003, "train/total_time_seconds": 983.8845108486712, "train/time_per_step_avg": 0.09820388998836278, "train/epoch_time_elapsed": 1725.7733395956457, "train/estimated_remaining_minutes": 0.0658557236177156}
|
| 1016 |
+
{"step": 9970, "epoch": 0.6377942681678608, "timestamp": 1785722689.4034424, "loss": 3.028191566467285, "grad_norm": 0.7215240597724915, "learning_rate": 0.0003, "train/total_time_seconds": 984.8631285429001, "train/time_per_step_avg": 0.09815916635096072, "train/epoch_time_elapsed": 1727.226377826184, "train/estimated_remaining_minutes": 0.04939133041840021}
|
| 1017 |
+
{"step": 9980, "epoch": 0.6384339815762539, "timestamp": 1785722690.851729, "loss": 3.032566261291504, "grad_norm": 0.7011223435401917, "learning_rate": 0.0003, "train/total_time_seconds": 985.8383800163865, "train/time_per_step_avg": 0.09813381716609001, "train/epoch_time_elapsed": 1728.674664311111, "train/estimated_remaining_minutes": 0.032927133601081716}
|
| 1018 |
+
{"step": 9990, "epoch": 0.6390736949846468, "timestamp": 1785722692.3017797, "loss": 3.028349494934082, "grad_norm": 0.7311228513717651, "learning_rate": 0.0003, "train/total_time_seconds": 986.8151098378003, "train/time_per_step_avg": 0.09807277131825685, "train/epoch_time_elapsed": 1730.1247146725655, "train/estimated_remaining_minutes": 0.016463381879175846}
|
| 1019 |
+
{"step": 10000, "epoch": 0.6397134083930399, "timestamp": 1785722693.7591815, "loss": 2.9733713150024412, "grad_norm": 0.7119616270065308, "learning_rate": 0.0003, "train/total_time_seconds": 987.7962170392275, "train/time_per_step_avg": 0.09810414493083953, "train/epoch_time_elapsed": 1731.5821167342365, "train/estimated_remaining_minutes": 0.0}
|
| 1020 |
+
{"step": 10000, "epoch": 0.6397134083930399, "timestamp": 1785722707.0118423, "eval_loss": 1.5107998847961426, "eval_runtime": 13.2511, "eval_samples_per_second": 759.255, "eval_steps_per_second": 23.772, "train/total_time_seconds": 987.7962170392275, "train/time_per_step_avg": 0.09810414493083953, "train/epoch_time_elapsed": 1744.8347763940692, "train/estimated_remaining_minutes": 0.0}
|
| 1021 |
+
{"step": 10000, "epoch": 0.6397134083930399, "timestamp": 1785722707.5659978, "train_runtime": 1745.3908, "train_samples_per_second": 366.68, "train_steps_per_second": 5.729, "total_flos": 3.506404589568e+16, "train_loss": 3.5420620965957643, "train/total_time_seconds": 987.7962170392275, "train/time_per_step_avg": 0.09810414493083953, "train/epoch_time_elapsed": 1745.3889307901263, "train/estimated_remaining_minutes": 0.0}
|
| 1022 |
+
{"step": 10000, "epoch": 0.6397134083930399, "timestamp": 1785722720.9161239, "eval_loss": 1.5107998847961426, "eval_runtime": 13.3475, "eval_samples_per_second": 753.772, "eval_steps_per_second": 23.6, "train/total_time_seconds": 987.7962170392275, "train/time_per_step_avg": 0.09810414493083953, "train/epoch_time_elapsed": 1758.7390583567321, "train/estimated_remaining_minutes": 0.0}
|