Upload entire model folder
Browse filesThis view is limited to 50 files because it contains too many changes. See raw diff
- out/gelu_run/chat_template.jinja +15 -0
- out/gelu_run/checkpoint-10000/chat_template.jinja +15 -0
- out/gelu_run/checkpoint-10000/config.json +34 -0
- out/gelu_run/checkpoint-10000/model.safetensors +3 -0
- out/gelu_run/checkpoint-10000/optimizer.pt +3 -0
- out/gelu_run/checkpoint-10000/rng_state.pth +3 -0
- out/gelu_run/checkpoint-10000/scheduler.pt +3 -0
- out/gelu_run/checkpoint-10000/tokenizer.json +0 -0
- out/gelu_run/checkpoint-10000/tokenizer_config.json +16 -0
- out/gelu_run/checkpoint-10000/trainer_state.json +0 -0
- out/gelu_run/checkpoint-10000/training_args.bin +3 -0
- out/gelu_run/checkpoint-7000/chat_template.jinja +15 -0
- out/gelu_run/checkpoint-7000/config.json +34 -0
- out/gelu_run/checkpoint-7000/model.safetensors +3 -0
- out/gelu_run/checkpoint-7000/optimizer.pt +3 -0
- out/gelu_run/checkpoint-7000/rng_state.pth +3 -0
- out/gelu_run/checkpoint-7000/scheduler.pt +3 -0
- out/gelu_run/checkpoint-7000/tokenizer.json +0 -0
- out/gelu_run/checkpoint-7000/tokenizer_config.json +16 -0
- out/gelu_run/checkpoint-7000/trainer_state.json +0 -0
- out/gelu_run/checkpoint-7000/training_args.bin +3 -0
- out/gelu_run/checkpoint-8000/chat_template.jinja +15 -0
- out/gelu_run/checkpoint-8000/config.json +34 -0
- out/gelu_run/checkpoint-8000/model.safetensors +3 -0
- out/gelu_run/checkpoint-8000/optimizer.pt +3 -0
- out/gelu_run/checkpoint-8000/rng_state.pth +3 -0
- out/gelu_run/checkpoint-8000/scheduler.pt +3 -0
- out/gelu_run/checkpoint-8000/tokenizer.json +0 -0
- out/gelu_run/checkpoint-8000/tokenizer_config.json +16 -0
- out/gelu_run/checkpoint-8000/trainer_state.json +0 -0
- out/gelu_run/checkpoint-8000/training_args.bin +3 -0
- out/gelu_run/checkpoint-9000/chat_template.jinja +15 -0
- out/gelu_run/checkpoint-9000/config.json +34 -0
- out/gelu_run/checkpoint-9000/model.safetensors +3 -0
- out/gelu_run/checkpoint-9000/optimizer.pt +3 -0
- out/gelu_run/checkpoint-9000/rng_state.pth +3 -0
- out/gelu_run/checkpoint-9000/scheduler.pt +3 -0
- out/gelu_run/checkpoint-9000/tokenizer.json +0 -0
- out/gelu_run/checkpoint-9000/tokenizer_config.json +16 -0
- out/gelu_run/checkpoint-9000/trainer_state.json +0 -0
- out/gelu_run/checkpoint-9000/training_args.bin +3 -0
- out/gelu_run/config.json +34 -0
- out/gelu_run/model.safetensors +3 -0
- out/gelu_run/tokenizer.json +0 -0
- out/gelu_run/tokenizer_config.json +16 -0
- out/gelu_run/training_args.bin +3 -0
- out/gelu_run/training_log.jsonl +0 -0
- out/relu_run/training_log.jsonl +94 -0
- wandb/debug-internal.log +102 -0
- wandb/debug.log +3 -0
out/gelu_run/chat_template.jinja
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{% for message in messages %}
|
| 2 |
+
{% if message['role'] == 'user' %}
|
| 3 |
+
{{ '<|user|>
|
| 4 |
+
' + message['content'] + eos_token }}
|
| 5 |
+
{% elif message['role'] == 'system' %}
|
| 6 |
+
{{ '<|system|>
|
| 7 |
+
' + message['content'] + eos_token }}
|
| 8 |
+
{% elif message['role'] == 'assistant' %}
|
| 9 |
+
{{ '<|assistant|>
|
| 10 |
+
' + message['content'] + eos_token }}
|
| 11 |
+
{% endif %}
|
| 12 |
+
{% if loop.last and add_generation_prompt %}
|
| 13 |
+
{{ '<|assistant|>' }}
|
| 14 |
+
{% endif %}
|
| 15 |
+
{% endfor %}
|
out/gelu_run/checkpoint-10000/chat_template.jinja
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{% for message in messages %}
|
| 2 |
+
{% if message['role'] == 'user' %}
|
| 3 |
+
{{ '<|user|>
|
| 4 |
+
' + message['content'] + eos_token }}
|
| 5 |
+
{% elif message['role'] == 'system' %}
|
| 6 |
+
{{ '<|system|>
|
| 7 |
+
' + message['content'] + eos_token }}
|
| 8 |
+
{% elif message['role'] == 'assistant' %}
|
| 9 |
+
{{ '<|assistant|>
|
| 10 |
+
' + message['content'] + eos_token }}
|
| 11 |
+
{% endif %}
|
| 12 |
+
{% if loop.last and add_generation_prompt %}
|
| 13 |
+
{{ '<|assistant|>' }}
|
| 14 |
+
{% endif %}
|
| 15 |
+
{% endfor %}
|
out/gelu_run/checkpoint-10000/config.json
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"TinyLlamaForCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 1,
|
| 8 |
+
"dtype": "float32",
|
| 9 |
+
"eos_token_id": 2,
|
| 10 |
+
"glu_activation": "gelu",
|
| 11 |
+
"head_dim": 64,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 512,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 768,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"model_type": "tiny_llama",
|
| 19 |
+
"num_attention_heads": 8,
|
| 20 |
+
"num_hidden_layers": 8,
|
| 21 |
+
"num_key_value_heads": 8,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pretraining_tp": 1,
|
| 24 |
+
"rms_norm_eps": 1e-06,
|
| 25 |
+
"rope_parameters": {
|
| 26 |
+
"rope_theta": 10000.0,
|
| 27 |
+
"rope_type": "default"
|
| 28 |
+
},
|
| 29 |
+
"tie_word_embeddings": true,
|
| 30 |
+
"tokenizer_name": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
|
| 31 |
+
"transformers_version": "5.15.0.dev0",
|
| 32 |
+
"use_cache": false,
|
| 33 |
+
"vocab_size": 32000
|
| 34 |
+
}
|
out/gelu_run/checkpoint-10000/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4ec409fb555945c681d01c23e9bf50bfb587f86512563b913a19ea594dce3e94
|
| 3 |
+
size 136882104
|
out/gelu_run/checkpoint-10000/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1ce6eeba65a1dc518c21cc7bf56d6c67357673fe02511241a08ba8419c4cb42d
|
| 3 |
+
size 273810682
|
out/gelu_run/checkpoint-10000/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:645b71843375baf4cc10bc75a2f0f04e91b8e3f8e8929f518a87022898b3bc20
|
| 3 |
+
size 14244
|
out/gelu_run/checkpoint-10000/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4943a4b68e3bb4800466ee6c597a8242d165d5e3adaf59ebce14536925495437
|
| 3 |
+
size 1064
|
out/gelu_run/checkpoint-10000/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/checkpoint-10000/tokenizer_config.json
ADDED
|
@@ -0,0 +1,16 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": null,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<s>",
|
| 5 |
+
"clean_up_tokenization_spaces": false,
|
| 6 |
+
"eos_token": "</s>",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 2048,
|
| 10 |
+
"pad_token": "</s>",
|
| 11 |
+
"padding_side": "right",
|
| 12 |
+
"sp_model_kwargs": {},
|
| 13 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 14 |
+
"unk_token": "<unk>",
|
| 15 |
+
"use_default_system_prompt": false
|
| 16 |
+
}
|
out/gelu_run/checkpoint-10000/trainer_state.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/checkpoint-10000/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b970f8059256215f59401779b251273c415c00e8bc3a4f752c0f0062c7212664
|
| 3 |
+
size 4856
|
out/gelu_run/checkpoint-7000/chat_template.jinja
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{% for message in messages %}
|
| 2 |
+
{% if message['role'] == 'user' %}
|
| 3 |
+
{{ '<|user|>
|
| 4 |
+
' + message['content'] + eos_token }}
|
| 5 |
+
{% elif message['role'] == 'system' %}
|
| 6 |
+
{{ '<|system|>
|
| 7 |
+
' + message['content'] + eos_token }}
|
| 8 |
+
{% elif message['role'] == 'assistant' %}
|
| 9 |
+
{{ '<|assistant|>
|
| 10 |
+
' + message['content'] + eos_token }}
|
| 11 |
+
{% endif %}
|
| 12 |
+
{% if loop.last and add_generation_prompt %}
|
| 13 |
+
{{ '<|assistant|>' }}
|
| 14 |
+
{% endif %}
|
| 15 |
+
{% endfor %}
|
out/gelu_run/checkpoint-7000/config.json
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"TinyLlamaForCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 1,
|
| 8 |
+
"dtype": "float32",
|
| 9 |
+
"eos_token_id": 2,
|
| 10 |
+
"glu_activation": "gelu",
|
| 11 |
+
"head_dim": 64,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 512,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 768,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"model_type": "tiny_llama",
|
| 19 |
+
"num_attention_heads": 8,
|
| 20 |
+
"num_hidden_layers": 8,
|
| 21 |
+
"num_key_value_heads": 8,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pretraining_tp": 1,
|
| 24 |
+
"rms_norm_eps": 1e-06,
|
| 25 |
+
"rope_parameters": {
|
| 26 |
+
"rope_theta": 10000.0,
|
| 27 |
+
"rope_type": "default"
|
| 28 |
+
},
|
| 29 |
+
"tie_word_embeddings": true,
|
| 30 |
+
"tokenizer_name": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
|
| 31 |
+
"transformers_version": "5.15.0.dev0",
|
| 32 |
+
"use_cache": false,
|
| 33 |
+
"vocab_size": 32000
|
| 34 |
+
}
|
out/gelu_run/checkpoint-7000/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:50bc2dfaab6d702829779320ad79d547d6fa931e5aadedd95ff69895b2f39931
|
| 3 |
+
size 136882104
|
out/gelu_run/checkpoint-7000/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:a6f2da3f05d5318fe337e84c9e7998fc652bfd593600793c655035d981cdd54e
|
| 3 |
+
size 273810682
|
out/gelu_run/checkpoint-7000/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c07c9483d2aaa0e0aa4859fa05bacc55a60e0f30ff9c95a3b76854e880483a96
|
| 3 |
+
size 14244
|
out/gelu_run/checkpoint-7000/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1a0dc548c399da7a74777f13ff24a614578e32d94c97052a52cc18045280c380
|
| 3 |
+
size 1064
|
out/gelu_run/checkpoint-7000/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/checkpoint-7000/tokenizer_config.json
ADDED
|
@@ -0,0 +1,16 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": null,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<s>",
|
| 5 |
+
"clean_up_tokenization_spaces": false,
|
| 6 |
+
"eos_token": "</s>",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 2048,
|
| 10 |
+
"pad_token": "</s>",
|
| 11 |
+
"padding_side": "right",
|
| 12 |
+
"sp_model_kwargs": {},
|
| 13 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 14 |
+
"unk_token": "<unk>",
|
| 15 |
+
"use_default_system_prompt": false
|
| 16 |
+
}
|
out/gelu_run/checkpoint-7000/trainer_state.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/checkpoint-7000/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b970f8059256215f59401779b251273c415c00e8bc3a4f752c0f0062c7212664
|
| 3 |
+
size 4856
|
out/gelu_run/checkpoint-8000/chat_template.jinja
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{% for message in messages %}
|
| 2 |
+
{% if message['role'] == 'user' %}
|
| 3 |
+
{{ '<|user|>
|
| 4 |
+
' + message['content'] + eos_token }}
|
| 5 |
+
{% elif message['role'] == 'system' %}
|
| 6 |
+
{{ '<|system|>
|
| 7 |
+
' + message['content'] + eos_token }}
|
| 8 |
+
{% elif message['role'] == 'assistant' %}
|
| 9 |
+
{{ '<|assistant|>
|
| 10 |
+
' + message['content'] + eos_token }}
|
| 11 |
+
{% endif %}
|
| 12 |
+
{% if loop.last and add_generation_prompt %}
|
| 13 |
+
{{ '<|assistant|>' }}
|
| 14 |
+
{% endif %}
|
| 15 |
+
{% endfor %}
|
out/gelu_run/checkpoint-8000/config.json
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"TinyLlamaForCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 1,
|
| 8 |
+
"dtype": "float32",
|
| 9 |
+
"eos_token_id": 2,
|
| 10 |
+
"glu_activation": "gelu",
|
| 11 |
+
"head_dim": 64,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 512,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 768,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"model_type": "tiny_llama",
|
| 19 |
+
"num_attention_heads": 8,
|
| 20 |
+
"num_hidden_layers": 8,
|
| 21 |
+
"num_key_value_heads": 8,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pretraining_tp": 1,
|
| 24 |
+
"rms_norm_eps": 1e-06,
|
| 25 |
+
"rope_parameters": {
|
| 26 |
+
"rope_theta": 10000.0,
|
| 27 |
+
"rope_type": "default"
|
| 28 |
+
},
|
| 29 |
+
"tie_word_embeddings": true,
|
| 30 |
+
"tokenizer_name": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
|
| 31 |
+
"transformers_version": "5.15.0.dev0",
|
| 32 |
+
"use_cache": false,
|
| 33 |
+
"vocab_size": 32000
|
| 34 |
+
}
|
out/gelu_run/checkpoint-8000/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b4261ac931950a5b62f5ef8a4e336825aadfcc3d12cefa37d1effa4ea1a55a1a
|
| 3 |
+
size 136882104
|
out/gelu_run/checkpoint-8000/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f2ee2b6a462e5baa7f89efe79bb271a41e82b8e1318a996e26b6a0d32984f2c5
|
| 3 |
+
size 273810682
|
out/gelu_run/checkpoint-8000/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f83fe17529e572dff2734bb21512b28dd7cf5d20ef0e84688f5068ffbf24e765
|
| 3 |
+
size 14244
|
out/gelu_run/checkpoint-8000/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:381367138b4854950cbcf5fe30898887456353bff1e8a79e81bdd4686166d372
|
| 3 |
+
size 1064
|
out/gelu_run/checkpoint-8000/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/checkpoint-8000/tokenizer_config.json
ADDED
|
@@ -0,0 +1,16 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": null,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<s>",
|
| 5 |
+
"clean_up_tokenization_spaces": false,
|
| 6 |
+
"eos_token": "</s>",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 2048,
|
| 10 |
+
"pad_token": "</s>",
|
| 11 |
+
"padding_side": "right",
|
| 12 |
+
"sp_model_kwargs": {},
|
| 13 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 14 |
+
"unk_token": "<unk>",
|
| 15 |
+
"use_default_system_prompt": false
|
| 16 |
+
}
|
out/gelu_run/checkpoint-8000/trainer_state.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/checkpoint-8000/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b970f8059256215f59401779b251273c415c00e8bc3a4f752c0f0062c7212664
|
| 3 |
+
size 4856
|
out/gelu_run/checkpoint-9000/chat_template.jinja
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{% for message in messages %}
|
| 2 |
+
{% if message['role'] == 'user' %}
|
| 3 |
+
{{ '<|user|>
|
| 4 |
+
' + message['content'] + eos_token }}
|
| 5 |
+
{% elif message['role'] == 'system' %}
|
| 6 |
+
{{ '<|system|>
|
| 7 |
+
' + message['content'] + eos_token }}
|
| 8 |
+
{% elif message['role'] == 'assistant' %}
|
| 9 |
+
{{ '<|assistant|>
|
| 10 |
+
' + message['content'] + eos_token }}
|
| 11 |
+
{% endif %}
|
| 12 |
+
{% if loop.last and add_generation_prompt %}
|
| 13 |
+
{{ '<|assistant|>' }}
|
| 14 |
+
{% endif %}
|
| 15 |
+
{% endfor %}
|
out/gelu_run/checkpoint-9000/config.json
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"TinyLlamaForCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 1,
|
| 8 |
+
"dtype": "float32",
|
| 9 |
+
"eos_token_id": 2,
|
| 10 |
+
"glu_activation": "gelu",
|
| 11 |
+
"head_dim": 64,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 512,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 768,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"model_type": "tiny_llama",
|
| 19 |
+
"num_attention_heads": 8,
|
| 20 |
+
"num_hidden_layers": 8,
|
| 21 |
+
"num_key_value_heads": 8,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pretraining_tp": 1,
|
| 24 |
+
"rms_norm_eps": 1e-06,
|
| 25 |
+
"rope_parameters": {
|
| 26 |
+
"rope_theta": 10000.0,
|
| 27 |
+
"rope_type": "default"
|
| 28 |
+
},
|
| 29 |
+
"tie_word_embeddings": true,
|
| 30 |
+
"tokenizer_name": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
|
| 31 |
+
"transformers_version": "5.15.0.dev0",
|
| 32 |
+
"use_cache": false,
|
| 33 |
+
"vocab_size": 32000
|
| 34 |
+
}
|
out/gelu_run/checkpoint-9000/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:cd5212e877a83a4fc0dda7d6e958f007f18a52855005b5ffca830e6e57c3fe8d
|
| 3 |
+
size 136882104
|
out/gelu_run/checkpoint-9000/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:a511b17dca8769a8e1ceea480b406662c8288b292b34475c795579aaedb5a301
|
| 3 |
+
size 273810682
|
out/gelu_run/checkpoint-9000/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:86a2aa7bca84d2b8e7dd4e04a286714ba9169af11c46c739950a52df4c45259f
|
| 3 |
+
size 14244
|
out/gelu_run/checkpoint-9000/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bede406dc99092b1999c6419d28e2ca4fcd37bc1ad90776facaeda39b41f2f8e
|
| 3 |
+
size 1064
|
out/gelu_run/checkpoint-9000/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/checkpoint-9000/tokenizer_config.json
ADDED
|
@@ -0,0 +1,16 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": null,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<s>",
|
| 5 |
+
"clean_up_tokenization_spaces": false,
|
| 6 |
+
"eos_token": "</s>",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 2048,
|
| 10 |
+
"pad_token": "</s>",
|
| 11 |
+
"padding_side": "right",
|
| 12 |
+
"sp_model_kwargs": {},
|
| 13 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 14 |
+
"unk_token": "<unk>",
|
| 15 |
+
"use_default_system_prompt": false
|
| 16 |
+
}
|
out/gelu_run/checkpoint-9000/trainer_state.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/checkpoint-9000/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b970f8059256215f59401779b251273c415c00e8bc3a4f752c0f0062c7212664
|
| 3 |
+
size 4856
|
out/gelu_run/config.json
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"TinyLlamaForCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 1,
|
| 8 |
+
"dtype": "float32",
|
| 9 |
+
"eos_token_id": 2,
|
| 10 |
+
"glu_activation": "gelu",
|
| 11 |
+
"head_dim": 64,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 512,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 768,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"model_type": "tiny_llama",
|
| 19 |
+
"num_attention_heads": 8,
|
| 20 |
+
"num_hidden_layers": 8,
|
| 21 |
+
"num_key_value_heads": 8,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pretraining_tp": 1,
|
| 24 |
+
"rms_norm_eps": 1e-06,
|
| 25 |
+
"rope_parameters": {
|
| 26 |
+
"rope_theta": 10000.0,
|
| 27 |
+
"rope_type": "default"
|
| 28 |
+
},
|
| 29 |
+
"tie_word_embeddings": true,
|
| 30 |
+
"tokenizer_name": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
|
| 31 |
+
"transformers_version": "5.15.0.dev0",
|
| 32 |
+
"use_cache": false,
|
| 33 |
+
"vocab_size": 32000
|
| 34 |
+
}
|
out/gelu_run/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4ec409fb555945c681d01c23e9bf50bfb587f86512563b913a19ea594dce3e94
|
| 3 |
+
size 136882104
|
out/gelu_run/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/gelu_run/tokenizer_config.json
ADDED
|
@@ -0,0 +1,16 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": null,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<s>",
|
| 5 |
+
"clean_up_tokenization_spaces": false,
|
| 6 |
+
"eos_token": "</s>",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 2048,
|
| 10 |
+
"pad_token": "</s>",
|
| 11 |
+
"padding_side": "right",
|
| 12 |
+
"sp_model_kwargs": {},
|
| 13 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 14 |
+
"unk_token": "<unk>",
|
| 15 |
+
"use_default_system_prompt": false
|
| 16 |
+
}
|
out/gelu_run/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b970f8059256215f59401779b251273c415c00e8bc3a4f752c0f0062c7212664
|
| 3 |
+
size 4856
|
out/gelu_run/training_log.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
out/relu_run/training_log.jsonl
ADDED
|
@@ -0,0 +1,94 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"step": 10, "epoch": 0.00063971340839304, "timestamp": 1785719189.1111567, "loss": 18.004437255859376, "grad_norm": 4.309175968170166, "learning_rate": 0.0003, "train/total_time_seconds": 1.1529871299862862, "train/time_per_step_avg": 0.11529871299862862, "train/epoch_time_elapsed": 1.698189478367567, "train/estimated_remaining_minutes": 19.197235714271663}
|
| 2 |
+
{"step": 20, "epoch": 0.00127942681678608, "timestamp": 1785719190.5587533, "loss": 14.253875732421875, "grad_norm": 2.558532953262329, "learning_rate": 0.0003, "train/total_time_seconds": 2.1405313163995743, "train/time_per_step_avg": 0.10702656581997871, "train/epoch_time_elapsed": 3.1457870826125145, "train/estimated_remaining_minutes": 17.80208544805646}
|
| 3 |
+
{"step": 30, "epoch": 0.0019191402251791197, "timestamp": 1785719192.0074282, "loss": 12.234906768798828, "grad_norm": 0.8670544624328613, "learning_rate": 0.0003, "train/total_time_seconds": 3.129369404166937, "train/time_per_step_avg": 0.10431231347223123, "train/epoch_time_elapsed": 4.594460878521204, "train/estimated_remaining_minutes": 17.333229421969087}
|
| 4 |
+
{"step": 40, "epoch": 0.00255885363357216, "timestamp": 1785719193.4926088, "loss": 11.569342803955077, "grad_norm": 1.631253957748413, "learning_rate": 0.0003, "train/total_time_seconds": 4.12174791097641, "train/time_per_step_avg": 0.10304369777441025, "train/epoch_time_elapsed": 6.079642463475466, "train/estimated_remaining_minutes": 17.1052538305521}
|
| 5 |
+
{"step": 50, "epoch": 0.0031985670419652, "timestamp": 1785719194.9443183, "loss": 10.887142181396484, "grad_norm": 2.238278388977051, "learning_rate": 0.0003, "train/total_time_seconds": 5.112706735730171, "train/time_per_step_avg": 0.10225413471460343, "train/epoch_time_elapsed": 7.531352140009403, "train/estimated_remaining_minutes": 16.9571440068384}
|
| 6 |
+
{"step": 60, "epoch": 0.0038382804503582393, "timestamp": 1785719196.389082, "loss": 10.173461151123046, "grad_norm": 1.5204575061798096, "learning_rate": 0.0003, "train/total_time_seconds": 6.097936179488897, "train/time_per_step_avg": 0.10163226965814828, "train/epoch_time_elapsed": 8.976115841418505, "train/estimated_remaining_minutes": 16.837079340033235}
|
| 7 |
+
{"step": 70, "epoch": 0.00447799385875128, "timestamp": 1785719197.8830686, "loss": 9.629255676269532, "grad_norm": 1.789215326309204, "learning_rate": 0.0003, "train/total_time_seconds": 7.0907769985497, "train/time_per_step_avg": 0.1012968142649957, "train/epoch_time_elapsed": 10.470102455466986, "train/estimated_remaining_minutes": 16.76462276085679}
|
| 8 |
+
{"step": 80, "epoch": 0.00511770726714432, "timestamp": 1785719199.3372583, "loss": 9.034149932861329, "grad_norm": 1.9468814134597778, "learning_rate": 0.0003, "train/total_time_seconds": 8.080103889107704, "train/time_per_step_avg": 0.1010012986138463, "train/epoch_time_elapsed": 11.924291852861643, "train/estimated_remaining_minutes": 16.698881370822587}
|
| 9 |
+
{"step": 90, "epoch": 0.00575742067553736, "timestamp": 1785719200.810397, "loss": 8.614398193359374, "grad_norm": 1.8147481679916382, "learning_rate": 0.0003, "train/total_time_seconds": 9.073108959943056, "train/time_per_step_avg": 0.10081232177714507, "train/epoch_time_elapsed": 13.39743061736226, "train/estimated_remaining_minutes": 16.65083514685846}
|
| 10 |
+
{"step": 100, "epoch": 0.0063971340839304, "timestamp": 1785719202.290287, "loss": 8.218663024902344, "grad_norm": 1.6181026697158813, "learning_rate": 0.0003, "train/total_time_seconds": 10.069692585617304, "train/time_per_step_avg": 0.10069692585617304, "train/epoch_time_elapsed": 14.87732070684433, "train/estimated_remaining_minutes": 16.61499276626855}
|
| 11 |
+
{"step": 110, "epoch": 0.007036847492323439, "timestamp": 1785719203.7516778, "loss": 7.84024658203125, "grad_norm": 1.5035417079925537, "learning_rate": 0.0003, "train/total_time_seconds": 11.06056372076273, "train/time_per_step_avg": 0.09907576590776443, "train/epoch_time_elapsed": 16.33871078491211, "train/estimated_remaining_minutes": 16.574087151264152}
|
| 12 |
+
{"step": 120, "epoch": 0.007676560900716479, "timestamp": 1785719205.238838, "loss": 7.585472869873047, "grad_norm": 1.8621912002563477, "learning_rate": 0.0003, "train/total_time_seconds": 12.066729228943586, "train/time_per_step_avg": 0.09926197912544012, "train/epoch_time_elapsed": 17.825870268046856, "train/estimated_remaining_minutes": 16.55823399749481}
|
| 13 |
+
{"step": 130, "epoch": 0.00831627430910952, "timestamp": 1785719206.7005105, "loss": 7.332099914550781, "grad_norm": 2.3431754112243652, "learning_rate": 0.0003, "train/total_time_seconds": 13.060431748628616, "train/time_per_step_avg": 0.09931062344461679, "train/epoch_time_elapsed": 19.28754399344325, "train/estimated_remaining_minutes": 16.526469404995442}
|
| 14 |
+
{"step": 140, "epoch": 0.00895598771750256, "timestamp": 1785719208.2131605, "loss": 7.122374725341797, "grad_norm": 1.8836675882339478, "learning_rate": 0.0003, "train/total_time_seconds": 14.06328347697854, "train/time_per_step_avg": 0.0994153556600213, "train/epoch_time_elapsed": 20.800194025039673, "train/estimated_remaining_minutes": 16.507616081310523}
|
| 15 |
+
{"step": 150, "epoch": 0.0095957011258956, "timestamp": 1785719209.6770594, "loss": 6.960295104980469, "grad_norm": 1.9998648166656494, "learning_rate": 0.0003, "train/total_time_seconds": 15.059290863573551, "train/time_per_step_avg": 0.0994658412784338, "train/epoch_time_elapsed": 22.264092408120632, "train/estimated_remaining_minutes": 16.481557222911054}
|
| 16 |
+
{"step": 160, "epoch": 0.01023541453428864, "timestamp": 1785719211.1549053, "loss": 6.762600708007812, "grad_norm": 1.9691828489303589, "learning_rate": 0.0003, "train/total_time_seconds": 16.054817087948322, "train/time_per_step_avg": 0.09956880908459426, "train/epoch_time_elapsed": 23.74193897470832, "train/estimated_remaining_minutes": 16.45618751514703}
|
| 17 |
+
{"step": 170, "epoch": 0.01087512794268168, "timestamp": 1785719212.6100845, "loss": 6.648001861572266, "grad_norm": 1.50315260887146, "learning_rate": 0.0003, "train/total_time_seconds": 17.046623900532722, "train/time_per_step_avg": 0.09955846901983023, "train/epoch_time_elapsed": 25.197118315845728, "train/estimated_remaining_minutes": 16.428265974729086}
|
| 18 |
+
{"step": 180, "epoch": 0.01151484135107472, "timestamp": 1785719214.0742285, "loss": 6.507088470458984, "grad_norm": 1.944074034690857, "learning_rate": 0.0003, "train/total_time_seconds": 18.04324832186103, "train/time_per_step_avg": 0.09963144432753325, "train/epoch_time_elapsed": 26.661262206733227, "train/estimated_remaining_minutes": 16.40599060376623}
|
| 19 |
+
{"step": 190, "epoch": 0.01215455475946776, "timestamp": 1785719215.5362978, "loss": 6.400433349609375, "grad_norm": 1.7968308925628662, "learning_rate": 0.0003, "train/total_time_seconds": 19.040667563676834, "train/time_per_step_avg": 0.09967558603733778, "train/epoch_time_elapsed": 28.123331412672997, "train/estimated_remaining_minutes": 16.38499550874296}
|
| 20 |
+
{"step": 200, "epoch": 0.0127942681678608, "timestamp": 1785719216.9950008, "loss": 6.253672027587891, "grad_norm": 2.0906436443328857, "learning_rate": 0.0003, "train/total_time_seconds": 20.030563607811928, "train/time_per_step_avg": 0.09960871022194624, "train/epoch_time_elapsed": 29.582034405320883, "train/estimated_remaining_minutes": 16.358293613046406}
|
| 21 |
+
{"step": 210, "epoch": 0.01343398157625384, "timestamp": 1785719218.596037, "loss": 6.116885375976563, "grad_norm": 1.6787160634994507, "learning_rate": 0.0003, "train/total_time_seconds": 21.149823278188705, "train/time_per_step_avg": 0.10089259557425975, "train/epoch_time_elapsed": 31.183070354163647, "train/estimated_remaining_minutes": 16.43307697567202}
|
| 22 |
+
{"step": 220, "epoch": 0.014073694984646877, "timestamp": 1785719220.0668635, "loss": 6.045794677734375, "grad_norm": 1.6631594896316528, "learning_rate": 0.0003, "train/total_time_seconds": 22.15688632428646, "train/time_per_step_avg": 0.10090157095342875, "train/epoch_time_elapsed": 32.65389749780297, "train/estimated_remaining_minutes": 16.416238503903152}
|
| 23 |
+
{"step": 230, "epoch": 0.014713408393039917, "timestamp": 1785719221.540909, "loss": 5.890323257446289, "grad_norm": 2.283379077911377, "learning_rate": 0.0003, "train/total_time_seconds": 23.153286557644606, "train/time_per_step_avg": 0.10092854809015989, "train/epoch_time_elapsed": 34.12794267013669, "train/estimated_remaining_minutes": 16.391855773057088}
|
| 24 |
+
{"step": 240, "epoch": 0.015353121801432957, "timestamp": 1785719222.9969306, "loss": 5.90706787109375, "grad_norm": 1.5012849569320679, "learning_rate": 0.0003, "train/total_time_seconds": 24.145556926727295, "train/time_per_step_avg": 0.10082273449748755, "train/epoch_time_elapsed": 35.583963833749294, "train/estimated_remaining_minutes": 16.365321917004056}
|
| 25 |
+
{"step": 250, "epoch": 0.015992835209825997, "timestamp": 1785719224.4922068, "loss": 5.829209899902343, "grad_norm": 2.286503791809082, "learning_rate": 0.0003, "train/total_time_seconds": 25.14661891013384, "train/time_per_step_avg": 0.10087328046560287, "train/epoch_time_elapsed": 37.07924070581794, "train/estimated_remaining_minutes": 16.345302291586997}
|
| 26 |
+
{"step": 260, "epoch": 0.01663254861821904, "timestamp": 1785719225.9523034, "loss": 5.7058265686035154, "grad_norm": 1.4215370416641235, "learning_rate": 0.0003, "train/total_time_seconds": 26.140215255320072, "train/time_per_step_avg": 0.1008539816737175, "train/epoch_time_elapsed": 38.539336904883385, "train/estimated_remaining_minutes": 16.320877986334455}
|
| 27 |
+
{"step": 270, "epoch": 0.017272262026612077, "timestamp": 1785719227.4154913, "loss": 5.705098342895508, "grad_norm": 1.9276142120361328, "learning_rate": 0.0003, "train/total_time_seconds": 27.13318219035864, "train/time_per_step_avg": 0.10086558289825916, "train/epoch_time_elapsed": 40.00252481177449, "train/estimated_remaining_minutes": 16.296658192110463}
|
| 28 |
+
{"step": 280, "epoch": 0.01791197543500512, "timestamp": 1785719228.8893838, "loss": 5.618948364257813, "grad_norm": 1.5141637325286865, "learning_rate": 0.0003, "train/total_time_seconds": 28.12769688665867, "train/time_per_step_avg": 0.10084448564797639, "train/epoch_time_elapsed": 41.476417388767004, "train/estimated_remaining_minutes": 16.27388177013823}
|
| 29 |
+
{"step": 290, "epoch": 0.018551688843398157, "timestamp": 1785719230.3500447, "loss": 5.5385387420654295, "grad_norm": 1.7944177389144897, "learning_rate": 0.0003, "train/total_time_seconds": 29.12158991023898, "train/time_per_step_avg": 0.10080922346562148, "train/epoch_time_elapsed": 42.937078054994345, "train/estimated_remaining_minutes": 16.251186093587386}
|
| 30 |
+
{"step": 300, "epoch": 0.0191914022517912, "timestamp": 1785719231.8145888, "loss": 5.497266387939453, "grad_norm": 1.815024971961975, "learning_rate": 0.0003, "train/total_time_seconds": 30.11681730300188, "train/time_per_step_avg": 0.10086253695189953, "train/epoch_time_elapsed": 44.401621997356415, "train/estimated_remaining_minutes": 16.229618213284347}
|
| 31 |
+
{"step": 310, "epoch": 0.019831115660184237, "timestamp": 1785719233.313466, "loss": 5.470532608032227, "grad_norm": 1.4523252248764038, "learning_rate": 0.0003, "train/total_time_seconds": 31.117917887866497, "train/time_per_step_avg": 0.09968094609677791, "train/epoch_time_elapsed": 45.90049961954355, "train/estimated_remaining_minutes": 16.21143141577561}
|
| 32 |
+
{"step": 320, "epoch": 0.02047082906857728, "timestamp": 1785719234.7794938, "loss": 5.364460754394531, "grad_norm": 1.5835351943969727, "learning_rate": 0.0003, "train/total_time_seconds": 32.11503814160824, "train/time_per_step_avg": 0.09958151817321777, "train/epoch_time_elapsed": 47.36652731895447, "train/estimated_remaining_minutes": 16.191331729727487}
|
| 33 |
+
{"step": 330, "epoch": 0.021110542476970317, "timestamp": 1785719236.24829, "loss": 5.339949035644532, "grad_norm": 1.6101388931274414, "learning_rate": 0.0003, "train/total_time_seconds": 33.112632278352976, "train/time_per_step_avg": 0.09959345720708371, "train/epoch_time_elapsed": 48.835323605686426, "train/estimated_remaining_minutes": 16.17167445109461}
|
| 34 |
+
{"step": 340, "epoch": 0.02175025588536336, "timestamp": 1785719237.716122, "loss": 5.278449249267578, "grad_norm": 1.6395161151885986, "learning_rate": 0.0003, "train/total_time_seconds": 34.10828187689185, "train/time_per_step_avg": 0.09962724950164556, "train/epoch_time_elapsed": 50.3031555339694, "train/estimated_remaining_minutes": 16.151274653469375}
|
| 35 |
+
{"step": 350, "epoch": 0.022389969293756397, "timestamp": 1785719239.2205873, "loss": 5.239136123657227, "grad_norm": 1.591071605682373, "learning_rate": 0.0003, "train/total_time_seconds": 35.110598020255566, "train/time_per_step_avg": 0.09963979110121728, "train/epoch_time_elapsed": 51.807620748877525, "train/estimated_remaining_minutes": 16.134155756926962}
|
| 36 |
+
{"step": 360, "epoch": 0.02302968270214944, "timestamp": 1785719240.7027545, "loss": 5.223877716064453, "grad_norm": 1.4954479932785034, "learning_rate": 0.0003, "train/total_time_seconds": 36.1084956638515, "train/time_per_step_avg": 0.09968280408531427, "train/epoch_time_elapsed": 53.28978818282485, "train/estimated_remaining_minutes": 16.1150878796078}
|
| 37 |
+
{"step": 370, "epoch": 0.023669396110542477, "timestamp": 1785719242.1836627, "loss": 5.152849578857422, "grad_norm": 1.4937726259231567, "learning_rate": 0.0003, "train/total_time_seconds": 37.103826370090246, "train/time_per_step_avg": 0.09970644179731608, "train/epoch_time_elapsed": 54.770696233958006, "train/estimated_remaining_minutes": 16.09503819567428}
|
| 38 |
+
{"step": 380, "epoch": 0.02430910951893552, "timestamp": 1785719243.6397634, "loss": 5.113955307006836, "grad_norm": 1.548889398574829, "learning_rate": 0.0003, "train/total_time_seconds": 38.097097013145685, "train/time_per_step_avg": 0.09969400126487017, "train/epoch_time_elapsed": 56.22679741680622, "train/estimated_remaining_minutes": 16.074301459055327}
|
| 39 |
+
{"step": 390, "epoch": 0.024948822927328557, "timestamp": 1785719245.1256514, "loss": 5.077383041381836, "grad_norm": 1.5740993022918701, "learning_rate": 0.0003, "train/total_time_seconds": 39.09447329118848, "train/time_per_step_avg": 0.09972883380949497, "train/epoch_time_elapsed": 57.71268515661359, "train/estimated_remaining_minutes": 16.055465313176125}
|
| 40 |
+
{"step": 400, "epoch": 0.0255885363357216, "timestamp": 1785719246.5798059, "loss": 5.060381698608398, "grad_norm": 1.467586636543274, "learning_rate": 0.0003, "train/total_time_seconds": 40.0868572331965, "train/time_per_step_avg": 0.09970039930194616, "train/epoch_time_elapsed": 59.16683987528086, "train/estimated_remaining_minutes": 16.034742893278597}
|
| 41 |
+
{"step": 410, "epoch": 0.026228249744114637, "timestamp": 1785719248.1836705, "loss": 5.042959594726563, "grad_norm": 1.8807436227798462, "learning_rate": 0.0003, "train/total_time_seconds": 41.20507439225912, "train/time_per_step_avg": 0.10087156504392623, "train/epoch_time_elapsed": 60.77070426568389, "train/estimated_remaining_minutes": 16.063279000884755}
|
| 42 |
+
{"step": 420, "epoch": 0.02686796315250768, "timestamp": 1785719249.6365585, "loss": 4.9587860107421875, "grad_norm": 1.496148705482483, "learning_rate": 0.0003, "train/total_time_seconds": 42.19562254101038, "train/time_per_step_avg": 0.10080584399402141, "train/epoch_time_elapsed": 62.22359195351601, "train/estimated_remaining_minutes": 16.041034283447598}
|
| 43 |
+
{"step": 430, "epoch": 0.027507676560900717, "timestamp": 1785719251.092583, "loss": 4.912609100341797, "grad_norm": 1.3773645162582397, "learning_rate": 0.0003, "train/total_time_seconds": 43.188217639923096, "train/time_per_step_avg": 0.1007558536157012, "train/epoch_time_elapsed": 63.679616283625364, "train/estimated_remaining_minutes": 16.019815612948218}
|
| 44 |
+
{"step": 440, "epoch": 0.028147389969293755, "timestamp": 1785719252.5474398, "loss": 4.895731353759766, "grad_norm": 1.4728689193725586, "learning_rate": 0.0003, "train/total_time_seconds": 44.1808406598866, "train/time_per_step_avg": 0.10072558782994748, "train/epoch_time_elapsed": 65.13447315618396, "train/estimated_remaining_minutes": 15.998819572292268}
|
| 45 |
+
{"step": 450, "epoch": 0.028787103377686796, "timestamp": 1785719254.0041158, "loss": 4.889030456542969, "grad_norm": 1.4282984733581543, "learning_rate": 0.0003, "train/total_time_seconds": 45.174056708812714, "train/time_per_step_avg": 0.10063458688557148, "train/epoch_time_elapsed": 66.5911492779851, "train/estimated_remaining_minutes": 15.9782311692282}
|
| 46 |
+
{"step": 460, "epoch": 0.029426816786079835, "timestamp": 1785719255.4690359, "loss": 4.8458507537841795, "grad_norm": 1.412023901939392, "learning_rate": 0.0003, "train/total_time_seconds": 46.17058386281133, "train/time_per_step_avg": 0.10062088198959827, "train/epoch_time_elapsed": 68.05606933310628, "train/estimated_remaining_minutes": 15.95896268301522}
|
| 47 |
+
{"step": 470, "epoch": 0.030066530194472876, "timestamp": 1785719256.9258096, "loss": 4.793928527832032, "grad_norm": 1.4973585605621338, "learning_rate": 0.0003, "train/total_time_seconds": 47.162097692489624, "train/time_per_step_avg": 0.10058271322399377, "train/epoch_time_elapsed": 69.5128436088562, "train/estimated_remaining_minutes": 15.938113156362629}
|
| 48 |
+
{"step": 480, "epoch": 0.030706243602865915, "timestamp": 1785719258.3887165, "loss": 4.759061050415039, "grad_norm": 1.4680202007293701, "learning_rate": 0.0003, "train/total_time_seconds": 48.154481112957, "train/time_per_step_avg": 0.10057384099811316, "train/epoch_time_elapsed": 70.97574964538217, "train/estimated_remaining_minutes": 15.917731256783009}
|
| 49 |
+
{"step": 490, "epoch": 0.03134595701125895, "timestamp": 1785719259.8527405, "loss": 4.734116744995117, "grad_norm": 1.4168442487716675, "learning_rate": 0.0003, "train/total_time_seconds": 49.151900950819254, "train/time_per_step_avg": 0.10057427659630776, "train/epoch_time_elapsed": 72.43977428972721, "train/estimated_remaining_minutes": 15.899135307560922}
|
| 50 |
+
{"step": 500, "epoch": 0.031985670419651994, "timestamp": 1785719261.3202562, "loss": 4.707389831542969, "grad_norm": 1.4198814630508423, "learning_rate": 0.0003, "train/total_time_seconds": 50.14931709319353, "train/time_per_step_avg": 0.10062459859997035, "train/epoch_time_elapsed": 73.9072899967432, "train/estimated_remaining_minutes": 15.880617079511286}
|
| 51 |
+
{"step": 500, "epoch": 0.031985670419651994, "timestamp": 1785719274.238652, "eval_loss": 2.3533623218536377, "eval_runtime": 12.9171, "eval_samples_per_second": 778.892, "eval_steps_per_second": 24.386, "train/total_time_seconds": 50.14931709319353, "train/time_per_step_avg": 0.10062459859997035, "train/epoch_time_elapsed": 86.8256843984127, "train/estimated_remaining_minutes": 15.880617079511286}
|
| 52 |
+
{"step": 510, "epoch": 0.032625383828045036, "timestamp": 1785719275.7055035, "loss": 4.726163482666015, "grad_norm": 1.461223840713501, "learning_rate": 0.0003, "train/total_time_seconds": 51.14596652239561, "train/time_per_step_avg": 0.0994089213013649, "train/epoch_time_elapsed": 88.29253654181957, "train/estimated_remaining_minutes": 15.861935369200468}
|
| 53 |
+
{"step": 520, "epoch": 0.03326509723643808, "timestamp": 1785719277.1655283, "loss": 4.630392837524414, "grad_norm": 1.250139594078064, "learning_rate": 0.0003, "train/total_time_seconds": 52.14178288727999, "train/time_per_step_avg": 0.09946160346269607, "train/epoch_time_elapsed": 89.752561442554, "train/estimated_remaining_minutes": 15.843080184981227}
|
| 54 |
+
{"step": 530, "epoch": 0.03390481064483111, "timestamp": 1785719278.6302316, "loss": 4.612015914916992, "grad_norm": 1.6344802379608154, "learning_rate": 0.0003, "train/total_time_seconds": 53.140134904533625, "train/time_per_step_avg": 0.09951917264610528, "train/epoch_time_elapsed": 91.21726486831903, "train/estimated_remaining_minutes": 15.825065331633125}
|
| 55 |
+
{"step": 540, "epoch": 0.034544524053224154, "timestamp": 1785719280.0899067, "loss": 4.634848785400391, "grad_norm": 1.388597011566162, "learning_rate": 0.0003, "train/total_time_seconds": 54.134869787842035, "train/time_per_step_avg": 0.09954029127955437, "train/epoch_time_elapsed": 92.67694038897753, "train/estimated_remaining_minutes": 15.806045314598322}
|
| 56 |
+
{"step": 550, "epoch": 0.035184237461617196, "timestamp": 1785719281.5600812, "loss": 4.609888076782227, "grad_norm": 1.614234447479248, "learning_rate": 0.0003, "train/total_time_seconds": 55.135467633605, "train/time_per_step_avg": 0.0996141092479229, "train/epoch_time_elapsed": 94.14711448922753, "train/estimated_remaining_minutes": 15.788793004168705}
|
| 57 |
+
{"step": 560, "epoch": 0.03582395087001024, "timestamp": 1785719283.020133, "loss": 4.582995223999023, "grad_norm": 1.5321508646011353, "learning_rate": 0.0003, "train/total_time_seconds": 56.13014132156968, "train/time_per_step_avg": 0.09959557458758354, "train/epoch_time_elapsed": 95.60716608911753, "train/estimated_remaining_minutes": 15.769896847488623}
|
| 58 |
+
{"step": 570, "epoch": 0.03646366427840327, "timestamp": 1785719284.4825404, "loss": 4.540353393554687, "grad_norm": 1.284172773361206, "learning_rate": 0.0003, "train/total_time_seconds": 57.12681749090552, "train/time_per_step_avg": 0.099647197984159, "train/epoch_time_elapsed": 97.0695738978684, "train/estimated_remaining_minutes": 15.751634179509914}
|
| 59 |
+
{"step": 580, "epoch": 0.037103377686796314, "timestamp": 1785719285.9528635, "loss": 4.539804458618164, "grad_norm": 1.4049098491668701, "learning_rate": 0.0003, "train/total_time_seconds": 58.125796280801296, "train/time_per_step_avg": 0.09971315167844295, "train/epoch_time_elapsed": 98.53989741206169, "train/estimated_remaining_minutes": 15.734051751872075}
|
| 60 |
+
{"step": 590, "epoch": 0.037743091095189356, "timestamp": 1785719287.4333954, "loss": 4.455770492553711, "grad_norm": 1.2758296728134155, "learning_rate": 0.0003, "train/total_time_seconds": 59.131169982254505, "train/time_per_step_avg": 0.0997926903143525, "train/epoch_time_elapsed": 100.02042876929045, "train/estimated_remaining_minutes": 15.718200834265957}
|
| 61 |
+
{"step": 600, "epoch": 0.0383828045035824, "timestamp": 1785719288.8902433, "loss": 4.478285217285157, "grad_norm": 1.392208218574524, "learning_rate": 0.0003, "train/total_time_seconds": 60.1265525072813, "train/time_per_step_avg": 0.09977235414087772, "train/epoch_time_elapsed": 101.47727706283331, "train/estimated_remaining_minutes": 15.699710932456785}
|
| 62 |
+
{"step": 610, "epoch": 0.03902251791197543, "timestamp": 1785719290.488418, "loss": 4.450063323974609, "grad_norm": 1.3019496202468872, "learning_rate": 0.0003, "train/total_time_seconds": 61.24152208119631, "train/time_per_step_avg": 0.10095555558800698, "train/epoch_time_elapsed": 103.07545157521963, "train/estimated_remaining_minutes": 15.711964271651185}
|
| 63 |
+
{"step": 620, "epoch": 0.039662231320368474, "timestamp": 1785719291.961032, "loss": 4.4534553527832035, "grad_norm": 1.3276724815368652, "learning_rate": 0.0003, "train/total_time_seconds": 62.24141678586602, "train/time_per_step_avg": 0.10099633898586034, "train/epoch_time_elapsed": 104.54806524142623, "train/estimated_remaining_minutes": 15.694206705683422}
|
| 64 |
+
{"step": 630, "epoch": 0.040301944728761516, "timestamp": 1785719293.4262903, "loss": 4.437715148925781, "grad_norm": 1.233879566192627, "learning_rate": 0.0003, "train/total_time_seconds": 63.23793585598469, "train/time_per_step_avg": 0.10097800951451064, "train/epoch_time_elapsed": 106.01332389935851, "train/estimated_remaining_minutes": 15.675647062713665}
|
| 65 |
+
{"step": 640, "epoch": 0.04094165813715456, "timestamp": 1785719294.9142194, "loss": 4.44427719116211, "grad_norm": 1.3350262641906738, "learning_rate": 0.0003, "train/total_time_seconds": 64.23674158006907, "train/time_per_step_avg": 0.1010187179222703, "train/epoch_time_elapsed": 107.50125190615654, "train/estimated_remaining_minutes": 15.657705760141834}
|
| 66 |
+
{"step": 650, "epoch": 0.04158137154554759, "timestamp": 1785719296.373651, "loss": 4.382160186767578, "grad_norm": 1.411807656288147, "learning_rate": 0.0003, "train/total_time_seconds": 65.23124710097909, "train/time_per_step_avg": 0.10095779467374086, "train/epoch_time_elapsed": 108.96068417280912, "train/estimated_remaining_minutes": 15.638773343439858}
|
| 67 |
+
{"step": 660, "epoch": 0.042221084953940634, "timestamp": 1785719297.833947, "loss": 4.355315017700195, "grad_norm": 1.2663954496383667, "learning_rate": 0.0003, "train/total_time_seconds": 66.22118797525764, "train/time_per_step_avg": 0.10091046653687955, "train/epoch_time_elapsed": 110.42098021879792, "train/estimated_remaining_minutes": 15.618835749719857}
|
| 68 |
+
{"step": 670, "epoch": 0.042860798362333676, "timestamp": 1785719299.28769, "loss": 4.370214462280273, "grad_norm": 1.2256451845169067, "learning_rate": 0.0003, "train/total_time_seconds": 67.2120272219181, "train/time_per_step_avg": 0.10085209731012583, "train/epoch_time_elapsed": 111.87472357228398, "train/estimated_remaining_minutes": 15.599209302997412}
|
| 69 |
+
{"step": 680, "epoch": 0.04350051177072672, "timestamp": 1785719300.7414699, "loss": 4.399151611328125, "grad_norm": 1.4314987659454346, "learning_rate": 0.0003, "train/total_time_seconds": 68.20391125231981, "train/time_per_step_avg": 0.10078114971518516, "train/epoch_time_elapsed": 113.32850352302194, "train/estimated_remaining_minutes": 15.579913060578937}
|
| 70 |
+
{"step": 690, "epoch": 0.04414022517911975, "timestamp": 1785719302.301291, "loss": 4.296121597290039, "grad_norm": 1.2699570655822754, "learning_rate": 0.0003, "train/total_time_seconds": 69.20489740371704, "train/time_per_step_avg": 0.10073727421462536, "train/epoch_time_elapsed": 114.88832456246018, "train/estimated_remaining_minutes": 15.56274383643975}
|
| 71 |
+
{"step": 700, "epoch": 0.044779938587512794, "timestamp": 1785719303.758604, "loss": 4.303484725952148, "grad_norm": 1.3015819787979126, "learning_rate": 0.0003, "train/total_time_seconds": 70.19706328585744, "train/time_per_step_avg": 0.10070510778576136, "train/epoch_time_elapsed": 116.34563748538494, "train/estimated_remaining_minutes": 15.543635441868433}
|
| 72 |
+
{"step": 710, "epoch": 0.045419651995905835, "timestamp": 1785719305.2220197, "loss": 4.266017913818359, "grad_norm": 1.326297402381897, "learning_rate": 0.0003, "train/total_time_seconds": 71.19194407388568, "train/time_per_step_avg": 0.0995042199268937, "train/epoch_time_elapsed": 117.80905290320516, "train/estimated_remaining_minutes": 15.5251915597746}
|
| 73 |
+
{"step": 720, "epoch": 0.04605936540429888, "timestamp": 1785719306.6752205, "loss": 4.257191467285156, "grad_norm": 1.2535629272460938, "learning_rate": 0.0003, "train/total_time_seconds": 72.18158435076475, "train/time_per_step_avg": 0.09940167564898729, "train/epoch_time_elapsed": 119.26225424185395, "train/estimated_remaining_minutes": 15.505673675349465}
|
| 74 |
+
{"step": 730, "epoch": 0.04669907881269191, "timestamp": 1785719308.1403859, "loss": 4.228657150268555, "grad_norm": 1.2637553215026855, "learning_rate": 0.0003, "train/total_time_seconds": 73.17771798744798, "train/time_per_step_avg": 0.09939782131463289, "train/epoch_time_elapsed": 120.72741932794452, "train/estimated_remaining_minutes": 15.487612916521526}
|
| 75 |
+
{"step": 740, "epoch": 0.047338792221084953, "timestamp": 1785719309.6129172, "loss": 4.259595108032227, "grad_norm": 1.2860547304153442, "learning_rate": 0.0003, "train/total_time_seconds": 74.1803835555911, "train/time_per_step_avg": 0.09943641975522041, "train/epoch_time_elapsed": 122.19995061680675, "train/estimated_remaining_minutes": 15.470953867675084}
|
| 76 |
+
{"step": 750, "epoch": 0.047978505629477995, "timestamp": 1785719311.0767155, "loss": 4.230247879028321, "grad_norm": 1.3347645998001099, "learning_rate": 0.0003, "train/total_time_seconds": 75.17563171684742, "train/time_per_step_avg": 0.0994438461586833, "train/epoch_time_elapsed": 123.66374891623855, "train/estimated_remaining_minutes": 15.452768741796413}
|
| 77 |
+
{"step": 760, "epoch": 0.04861821903787104, "timestamp": 1785719312.540694, "loss": 4.228657150268555, "grad_norm": 1.2362548112869263, "learning_rate": 0.0003, "train/total_time_seconds": 76.17176395654678, "train/time_per_step_avg": 0.09950575981289149, "train/epoch_time_elapsed": 125.12772729992867, "train/estimated_remaining_minutes": 15.434804801721322}
|
| 78 |
+
{"step": 770, "epoch": 0.04925793244626407, "timestamp": 1785719314.0035617, "loss": 4.215970611572265, "grad_norm": 1.250531792640686, "learning_rate": 0.0003, "train/total_time_seconds": 77.16775855049491, "train/time_per_step_avg": 0.09955731328576803, "train/epoch_time_elapsed": 126.59059526026249, "train/estimated_remaining_minutes": 15.41684873205775}
|
| 79 |
+
{"step": 780, "epoch": 0.04989764585465711, "timestamp": 1785719315.4730327, "loss": 4.176557540893555, "grad_norm": 1.2180434465408325, "learning_rate": 0.0003, "train/total_time_seconds": 78.16844398900867, "train/time_per_step_avg": 0.09964532736688853, "train/epoch_time_elapsed": 128.06006614118814, "train/estimated_remaining_minutes": 15.399851572193587}
|
| 80 |
+
{"step": 790, "epoch": 0.050537359263050155, "timestamp": 1785719316.9590044, "loss": 4.230543518066407, "grad_norm": 1.2370671033859253, "learning_rate": 0.0003, "train/total_time_seconds": 79.16411947831511, "train/time_per_step_avg": 0.09959222074598074, "train/epoch_time_elapsed": 129.54603765159845, "train/estimated_remaining_minutes": 15.381889037875151}
|
| 81 |
+
{"step": 800, "epoch": 0.0511770726714432, "timestamp": 1785719318.4233124, "loss": 4.1455940246582035, "grad_norm": 1.2756640911102295, "learning_rate": 0.0003, "train/total_time_seconds": 80.15707350894809, "train/time_per_step_avg": 0.09960010223090648, "train/epoch_time_elapsed": 131.01034566015005, "train/estimated_remaining_minutes": 15.363439089215051}
|
| 82 |
+
{"step": 810, "epoch": 0.05181678607983623, "timestamp": 1785719320.0209892, "loss": 4.170082473754883, "grad_norm": 1.2409402132034302, "learning_rate": 0.0003, "train/total_time_seconds": 81.26929449662566, "train/time_per_step_avg": 0.10077350422739982, "train/epoch_time_elapsed": 132.60802285000682, "train/estimated_remaining_minutes": 15.367588815308434}
|
| 83 |
+
{"step": 820, "epoch": 0.05245649948822927, "timestamp": 1785719321.504152, "loss": 4.1208335876464846, "grad_norm": 1.4059659242630005, "learning_rate": 0.0003, "train/total_time_seconds": 82.2749318704009, "train/time_per_step_avg": 0.10093347519636155, "train/epoch_time_elapsed": 134.09118515625596, "train/estimated_remaining_minutes": 15.351298263623583}
|
| 84 |
+
{"step": 830, "epoch": 0.053096212896622315, "timestamp": 1785719322.9731612, "loss": 4.118441772460938, "grad_norm": 1.3174408674240112, "learning_rate": 0.0003, "train/total_time_seconds": 83.27185544371605, "train/time_per_step_avg": 0.10094137456268072, "train/epoch_time_elapsed": 135.56019471213222, "train/estimated_remaining_minutes": 15.333391855800725}
|
| 85 |
+
{"step": 840, "epoch": 0.05373592630501536, "timestamp": 1785719324.4390838, "loss": 4.081402206420899, "grad_norm": 1.2978497743606567, "learning_rate": 0.0003, "train/total_time_seconds": 84.26777067407966, "train/time_per_step_avg": 0.1008738711848855, "train/epoch_time_elapsed": 137.02611757442355, "train/estimated_remaining_minutes": 15.315332924098605}
|
| 86 |
+
{"step": 850, "epoch": 0.05437563971340839, "timestamp": 1785719325.900901, "loss": 4.122738647460937, "grad_norm": 1.3451037406921387, "learning_rate": 0.0003, "train/total_time_seconds": 85.2613017782569, "train/time_per_step_avg": 0.10085670061409474, "train/epoch_time_elapsed": 138.48793453723192, "train/estimated_remaining_minutes": 15.296880613157855}
|
| 87 |
+
{"step": 860, "epoch": 0.05501535312180143, "timestamp": 1785719327.3831222, "loss": 4.078413772583008, "grad_norm": 1.1879112720489502, "learning_rate": 0.0003, "train/total_time_seconds": 86.25609136745334, "train/time_per_step_avg": 0.10084327410906553, "train/epoch_time_elapsed": 139.97015580534935, "train/estimated_remaining_minutes": 15.278695253847355}
|
| 88 |
+
{"step": 870, "epoch": 0.055655066530194475, "timestamp": 1785719328.8491452, "loss": 4.0526477813720705, "grad_norm": 1.2357953786849976, "learning_rate": 0.0003, "train/total_time_seconds": 87.25300635769963, "train/time_per_step_avg": 0.10085247807204724, "train/epoch_time_elapsed": 141.43617785349488, "train/estimated_remaining_minutes": 15.26091854493865}
|
| 89 |
+
{"step": 880, "epoch": 0.05629477993858751, "timestamp": 1785719330.3108025, "loss": 4.045436096191406, "grad_norm": 1.253247857093811, "learning_rate": 0.0003, "train/total_time_seconds": 88.247319560498, "train/time_per_step_avg": 0.10078875571489335, "train/epoch_time_elapsed": 142.89783620461822, "train/estimated_remaining_minutes": 15.242718833176927}
|
| 90 |
+
{"step": 890, "epoch": 0.05693449334698055, "timestamp": 1785719331.793757, "loss": 4.033988952636719, "grad_norm": 1.2447755336761475, "learning_rate": 0.0003, "train/total_time_seconds": 89.24208964779973, "train/time_per_step_avg": 0.10077970169484615, "train/epoch_time_elapsed": 144.38079082220793, "train/estimated_remaining_minutes": 15.224633645907407}
|
| 91 |
+
{"step": 900, "epoch": 0.05757420675537359, "timestamp": 1785719333.2658997, "loss": 4.0308879852294925, "grad_norm": 1.3001246452331543, "learning_rate": 0.0003, "train/total_time_seconds": 90.23787976801395, "train/time_per_step_avg": 0.10080806259065866, "train/epoch_time_elapsed": 145.85293336585164, "train/estimated_remaining_minutes": 15.206753812757906}
|
| 92 |
+
{"step": 910, "epoch": 0.058213920163766635, "timestamp": 1785719334.7371788, "loss": 4.00530891418457, "grad_norm": 1.2262362241744995, "learning_rate": 0.0003, "train/total_time_seconds": 91.23814650252461, "train/time_per_step_avg": 0.09968852005898952, "train/epoch_time_elapsed": 147.32421227917075, "train/estimated_remaining_minutes": 15.189647467178549}
|
| 93 |
+
{"step": 920, "epoch": 0.05885363357215967, "timestamp": 1785719336.21605, "loss": 4.024139404296875, "grad_norm": 1.1803182363510132, "learning_rate": 0.0003, "train/total_time_seconds": 92.24092115089297, "train/time_per_step_avg": 0.09965989280492067, "train/epoch_time_elapsed": 148.80308332294226, "train/estimated_remaining_minutes": 15.172963116849786}
|
| 94 |
+
{"step": 930, "epoch": 0.05949334698055271, "timestamp": 1785719337.6804287, "loss": 3.9877784729003904, "grad_norm": 1.3404192924499512, "learning_rate": 0.0003, "train/total_time_seconds": 93.23683537915349, "train/time_per_step_avg": 0.0996497993543744, "train/epoch_time_elapsed": 150.2674617767334, "train/estimated_remaining_minutes": 15.155163026683192}
|
wandb/debug-internal.log
CHANGED
|
@@ -397,3 +397,105 @@
|
|
| 397 |
{"time":"2026-08-03T00:55:43.664189298Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 398 |
{"time":"2026-08-03T00:55:58.550060391Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1681,"history_lines":3,"events_offset":387,"events_lines":2,"console_offset":1811,"console_lines":4}
|
| 399 |
{"time":"2026-08-03T00:55:58.754813595Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 397 |
{"time":"2026-08-03T00:55:43.664189298Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 398 |
{"time":"2026-08-03T00:55:58.550060391Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1681,"history_lines":3,"events_offset":387,"events_lines":2,"console_offset":1811,"console_lines":4}
|
| 399 |
{"time":"2026-08-03T00:55:58.754813595Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 400 |
+
{"time":"2026-08-03T00:56:13.550087773Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1684,"history_lines":9,"events_offset":389,"events_lines":2,"console_offset":1814,"console_lines":10}
|
| 401 |
+
{"time":"2026-08-03T00:56:13.717511542Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 402 |
+
{"time":"2026-08-03T00:56:28.550489543Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1693,"history_lines":10,"events_offset":391,"events_lines":2,"console_offset":1824,"console_lines":10}
|
| 403 |
+
{"time":"2026-08-03T00:56:28.777816331Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 404 |
+
{"time":"2026-08-03T00:56:43.550673555Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1703,"history_lines":10,"events_offset":393,"events_lines":2,"console_offset":1834,"console_lines":10}
|
| 405 |
+
{"time":"2026-08-03T00:56:43.78519462Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 406 |
+
{"time":"2026-08-03T00:56:58.55076738Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1713,"history_lines":10,"events_offset":395,"events_lines":2,"console_offset":1844,"console_lines":10}
|
| 407 |
+
{"time":"2026-08-03T00:56:58.721573859Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 408 |
+
{"time":"2026-08-03T00:57:13.550770032Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1723,"history_lines":11,"events_offset":397,"events_lines":2,"console_offset":1854,"console_lines":11}
|
| 409 |
+
{"time":"2026-08-03T00:57:13.718779607Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 410 |
+
{"time":"2026-08-03T00:57:28.549777011Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1734,"history_lines":2,"events_offset":399,"events_lines":2,"console_offset":1865,"console_lines":6}
|
| 411 |
+
{"time":"2026-08-03T00:57:28.807387808Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 412 |
+
{"time":"2026-08-03T00:57:43.550687467Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1736,"history_lines":10,"events_offset":401,"events_lines":2,"console_offset":1870,"console_lines":13}
|
| 413 |
+
{"time":"2026-08-03T00:57:43.733825279Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 414 |
+
{"time":"2026-08-03T00:57:58.550151554Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1746,"history_lines":10,"events_offset":403,"events_lines":2,"console_offset":1872,"console_lines":1}
|
| 415 |
+
{"time":"2026-08-03T00:57:58.814167942Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 416 |
+
{"time":"2026-08-03T00:58:13.550463266Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1756,"history_lines":10,"events_offset":405,"events_lines":2,"console_offset":1872,"console_lines":1}
|
| 417 |
+
{"time":"2026-08-03T00:58:13.818457383Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 418 |
+
{"time":"2026-08-03T00:58:28.550438994Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1766,"history_lines":10,"events_offset":407,"events_lines":2,"console_offset":1872,"console_lines":1}
|
| 419 |
+
{"time":"2026-08-03T00:58:28.727753261Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 420 |
+
{"time":"2026-08-03T00:58:43.55068435Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1776,"history_lines":10,"events_offset":409,"events_lines":2,"console_offset":1883,"console_lines":41}
|
| 421 |
+
{"time":"2026-08-03T00:58:43.7761903Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 422 |
+
{"time":"2026-08-03T00:58:58.550710506Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1786,"history_lines":3,"events_offset":411,"events_lines":2,"console_offset":1923,"console_lines":4}
|
| 423 |
+
{"time":"2026-08-03T00:58:58.831384598Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 424 |
+
{"time":"2026-08-03T00:59:13.551684463Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1789,"history_lines":10,"events_offset":413,"events_lines":2,"console_offset":1927,"console_lines":10}
|
| 425 |
+
{"time":"2026-08-03T00:59:13.780301332Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 426 |
+
{"time":"2026-08-03T00:59:28.550184306Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1799,"history_lines":10,"events_offset":415,"events_lines":2,"console_offset":1937,"console_lines":10}
|
| 427 |
+
{"time":"2026-08-03T00:59:28.728884059Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 428 |
+
{"time":"2026-08-03T00:59:43.550656467Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1809,"history_lines":10,"events_offset":417,"events_lines":2,"console_offset":1947,"console_lines":10}
|
| 429 |
+
{"time":"2026-08-03T00:59:43.791763247Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 430 |
+
{"time":"2026-08-03T00:59:58.550055315Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1819,"history_lines":10,"events_offset":419,"events_lines":2,"console_offset":1957,"console_lines":10}
|
| 431 |
+
{"time":"2026-08-03T00:59:58.767674287Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 432 |
+
{"time":"2026-08-03T01:00:13.550645833Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1829,"history_lines":8,"events_offset":421,"events_lines":2,"console_offset":1967,"console_lines":8}
|
| 433 |
+
{"time":"2026-08-03T01:00:13.772044586Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 434 |
+
{"time":"2026-08-03T01:00:28.550051784Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1837,"history_lines":4,"events_offset":423,"events_lines":2,"console_offset":1975,"console_lines":10}
|
| 435 |
+
{"time":"2026-08-03T01:00:28.822677732Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 436 |
+
{"time":"2026-08-03T01:00:43.550249534Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1841,"history_lines":10,"events_offset":425,"events_lines":2,"console_offset":1981,"console_lines":1}
|
| 437 |
+
{"time":"2026-08-03T01:00:43.746900507Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 438 |
+
{"time":"2026-08-03T01:00:58.550444195Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1851,"history_lines":10,"events_offset":427,"events_lines":2,"console_offset":1981,"console_lines":1}
|
| 439 |
+
{"time":"2026-08-03T01:00:58.754990538Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 440 |
+
{"time":"2026-08-03T01:01:13.550214303Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1861,"history_lines":10,"events_offset":429,"events_lines":2,"console_offset":1981,"console_lines":1}
|
| 441 |
+
{"time":"2026-08-03T01:01:13.776225592Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 442 |
+
{"time":"2026-08-03T01:01:28.550688535Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1871,"history_lines":10,"events_offset":431,"events_lines":2,"console_offset":1985,"console_lines":40}
|
| 443 |
+
{"time":"2026-08-03T01:01:28.694176036Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 444 |
+
{"time":"2026-08-03T01:01:43.550419078Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1881,"history_lines":7,"events_offset":433,"events_lines":2,"console_offset":2025,"console_lines":8}
|
| 445 |
+
{"time":"2026-08-03T01:01:43.818236113Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 446 |
+
{"time":"2026-08-03T01:01:58.549799079Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1888,"history_lines":5,"events_offset":435,"events_lines":2,"console_offset":2032,"console_lines":6}
|
| 447 |
+
{"time":"2026-08-03T01:01:58.838309139Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 448 |
+
{"time":"2026-08-03T01:02:13.550033016Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1893,"history_lines":10,"events_offset":437,"events_lines":2,"console_offset":2038,"console_lines":10}
|
| 449 |
+
{"time":"2026-08-03T01:02:13.803961916Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 450 |
+
{"time":"2026-08-03T01:02:28.550231875Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1903,"history_lines":11,"events_offset":439,"events_lines":2,"console_offset":2048,"console_lines":11}
|
| 451 |
+
{"time":"2026-08-03T01:02:28.75168613Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 452 |
+
{"time":"2026-08-03T01:02:43.550561626Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1914,"history_lines":10,"events_offset":441,"events_lines":2,"console_offset":2059,"console_lines":10}
|
| 453 |
+
{"time":"2026-08-03T01:02:43.767591115Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 454 |
+
{"time":"2026-08-03T01:02:58.550810429Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1924,"history_lines":10,"events_offset":443,"events_lines":2,"console_offset":2069,"console_lines":10}
|
| 455 |
+
{"time":"2026-08-03T01:02:58.816756139Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 456 |
+
{"time":"2026-08-03T01:03:13.550224275Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1934,"history_lines":5,"events_offset":445,"events_lines":2,"console_offset":2079,"console_lines":5}
|
| 457 |
+
{"time":"2026-08-03T01:03:13.769408143Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 458 |
+
{"time":"2026-08-03T01:03:28.550216736Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1939,"history_lines":7,"events_offset":447,"events_lines":2,"console_offset":2084,"console_lines":13}
|
| 459 |
+
{"time":"2026-08-03T01:03:28.804054343Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 460 |
+
{"time":"2026-08-03T01:03:43.55060799Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1946,"history_lines":10,"events_offset":449,"events_lines":2,"console_offset":2090,"console_lines":1}
|
| 461 |
+
{"time":"2026-08-03T01:03:43.744693422Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 462 |
+
{"time":"2026-08-03T01:03:58.550340313Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1956,"history_lines":10,"events_offset":451,"events_lines":2,"console_offset":2090,"console_lines":1}
|
| 463 |
+
{"time":"2026-08-03T01:03:58.750867667Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 464 |
+
{"time":"2026-08-03T01:04:13.550051306Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1966,"history_lines":10,"events_offset":453,"events_lines":2,"console_offset":2090,"console_lines":1}
|
| 465 |
+
{"time":"2026-08-03T01:04:13.668811543Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 466 |
+
{"time":"2026-08-03T01:04:28.551083444Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1976,"history_lines":10,"events_offset":455,"events_lines":2,"console_offset":2097,"console_lines":40}
|
| 467 |
+
{"time":"2026-08-03T01:04:28.812531524Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 468 |
+
{"time":"2026-08-03T01:04:43.54998532Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1986,"history_lines":4,"events_offset":457,"events_lines":2,"console_offset":2137,"console_lines":5}
|
| 469 |
+
{"time":"2026-08-03T01:04:43.793236385Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 470 |
+
{"time":"2026-08-03T01:04:58.550511267Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1990,"history_lines":9,"events_offset":459,"events_lines":2,"console_offset":2141,"console_lines":10}
|
| 471 |
+
{"time":"2026-08-03T01:04:58.796124411Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 472 |
+
{"time":"2026-08-03T01:05:13.549753544Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1999,"history_lines":10,"events_offset":461,"events_lines":2,"console_offset":2151,"console_lines":10}
|
| 473 |
+
{"time":"2026-08-03T01:05:13.701590106Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 474 |
+
{"time":"2026-08-03T01:05:28.550617491Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2009,"history_lines":10,"events_offset":463,"events_lines":2,"console_offset":2161,"console_lines":10}
|
| 475 |
+
{"time":"2026-08-03T01:05:28.772307906Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 476 |
+
{"time":"2026-08-03T01:05:43.550213351Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2019,"history_lines":10,"events_offset":465,"events_lines":2,"console_offset":2171,"console_lines":10}
|
| 477 |
+
{"time":"2026-08-03T01:05:43.721744871Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 478 |
+
{"time":"2026-08-03T01:05:58.550400194Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2029,"history_lines":10,"events_offset":467,"events_lines":2,"console_offset":2181,"console_lines":10}
|
| 479 |
+
{"time":"2026-08-03T01:05:58.704180764Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 480 |
+
{"time":"2026-08-03T01:06:13.549970457Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2039,"history_lines":4,"events_offset":469,"events_lines":2,"console_offset":2191,"console_lines":8}
|
| 481 |
+
{"time":"2026-08-03T01:06:13.671696183Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 482 |
+
{"time":"2026-08-03T01:06:28.550701679Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2043,"history_lines":1,"events_offset":471,"events_lines":2,"console_offset":2199,"console_lines":17}
|
| 483 |
+
{"time":"2026-08-03T01:06:28.867117373Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 484 |
+
{"time":"2026-08-03T01:06:43.550254163Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2044,"history_lines":10,"events_offset":473,"events_lines":2,"console_offset":2215,"console_lines":11}
|
| 485 |
+
{"time":"2026-08-03T01:06:43.782032147Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 486 |
+
{"time":"2026-08-03T01:06:58.550746654Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2054,"history_lines":10,"events_offset":475,"events_lines":2,"console_offset":2215,"console_lines":1}
|
| 487 |
+
{"time":"2026-08-03T01:06:58.791149265Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 488 |
+
{"time":"2026-08-03T01:07:13.550622621Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2064,"history_lines":11,"events_offset":477,"events_lines":2,"console_offset":2215,"console_lines":1}
|
| 489 |
+
{"time":"2026-08-03T01:07:13.755607461Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 490 |
+
{"time":"2026-08-03T01:07:28.55036951Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2075,"history_lines":10,"events_offset":479,"events_lines":2,"console_offset":2215,"console_lines":1}
|
| 491 |
+
{"time":"2026-08-03T01:07:28.737032121Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 492 |
+
{"time":"2026-08-03T01:07:43.550342975Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2085,"history_lines":9,"events_offset":481,"events_lines":2,"console_offset":2226,"console_lines":41}
|
| 493 |
+
{"time":"2026-08-03T01:07:43.786587583Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 494 |
+
{"time":"2026-08-03T01:07:58.550273635Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2094,"history_lines":3,"events_offset":483,"events_lines":2,"console_offset":2266,"console_lines":4}
|
| 495 |
+
{"time":"2026-08-03T01:07:58.713046832Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 496 |
+
{"time":"2026-08-03T01:08:13.550010348Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2097,"history_lines":11,"events_offset":485,"events_lines":2,"console_offset":2270,"console_lines":11}
|
| 497 |
+
{"time":"2026-08-03T01:08:13.724805172Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 498 |
+
{"time":"2026-08-03T01:08:28.550377407Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2108,"history_lines":10,"events_offset":487,"events_lines":2,"console_offset":2281,"console_lines":10}
|
| 499 |
+
{"time":"2026-08-03T01:08:28.745573723Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
| 500 |
+
{"time":"2026-08-03T01:08:43.550230836Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2118,"history_lines":10,"events_offset":489,"events_lines":2,"console_offset":2291,"console_lines":10}
|
| 501 |
+
{"time":"2026-08-03T01:08:43.758131806Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
|
wandb/debug.log
CHANGED
|
@@ -24,3 +24,6 @@ config: {'_wandb': {}}
|
|
| 24 |
2026-08-03 00:36:57,398 INFO MainThread:566578 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.15.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 32000, 'hidden_size': 512, 'intermediate_size': 768, 'num_hidden_layers': 8, 'num_attention_heads': 8, 'num_key_value_heads': 8, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 64, '_name_or_path': '', 'tokenizer_name': 'TinyLlama/TinyLlama-1.1B-Chat-v1.0', 'glu_activation': 'gelu', 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/gelu_run', 'per_device_train_batch_size': 32, 'num_train_epochs': 1, 'max_steps': 10000, 'learning_rate': 0.0003, 'lr_scheduler_type': 'constant', 'lr_scheduler_kwargs': None, 'warmup_steps': 0, 'optim': 'adamw_torch', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 2, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 10, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': None, 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 500, 'eval_delay': 0, 'per_device_eval_batch_size': 32, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 1000, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/tiny-llama-baseline-gelu', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
|
| 25 |
2026-08-03 00:36:57,399 INFO MainThread:566578 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 34218496 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x148c6681ba50>>
|
| 26 |
2026-08-03 00:36:57,399 INFO MainThread:566578 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 34218496 None
|
|
|
|
|
|
|
|
|
|
|
|
| 24 |
2026-08-03 00:36:57,398 INFO MainThread:566578 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.15.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 32000, 'hidden_size': 512, 'intermediate_size': 768, 'num_hidden_layers': 8, 'num_attention_heads': 8, 'num_key_value_heads': 8, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 64, '_name_or_path': '', 'tokenizer_name': 'TinyLlama/TinyLlama-1.1B-Chat-v1.0', 'glu_activation': 'gelu', 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/gelu_run', 'per_device_train_batch_size': 32, 'num_train_epochs': 1, 'max_steps': 10000, 'learning_rate': 0.0003, 'lr_scheduler_type': 'constant', 'lr_scheduler_kwargs': None, 'warmup_steps': 0, 'optim': 'adamw_torch', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 2, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 10, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': None, 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 500, 'eval_delay': 0, 'per_device_eval_batch_size': 32, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 1000, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/tiny-llama-baseline-gelu', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
|
| 25 |
2026-08-03 00:36:57,399 INFO MainThread:566578 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 34218496 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x148c6681ba50>>
|
| 26 |
2026-08-03 00:36:57,399 INFO MainThread:566578 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 34218496 None
|
| 27 |
+
2026-08-03 01:06:27,410 INFO MainThread:566578 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.15.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 32000, 'hidden_size': 512, 'intermediate_size': 768, 'num_hidden_layers': 8, 'num_attention_heads': 8, 'num_key_value_heads': 8, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 64, '_name_or_path': '', 'tokenizer_name': 'TinyLlama/TinyLlama-1.1B-Chat-v1.0', 'glu_activation': 'relu', 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/relu_run', 'per_device_train_batch_size': 32, 'num_train_epochs': 1, 'max_steps': 10000, 'learning_rate': 0.0003, 'lr_scheduler_type': 'constant', 'lr_scheduler_kwargs': None, 'warmup_steps': 0, 'optim': 'adamw_torch', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 2, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 10, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': None, 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 500, 'eval_delay': 0, 'per_device_eval_batch_size': 32, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 1000, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/tiny-llama-baseline-relu', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
|
| 28 |
+
2026-08-03 01:06:27,412 INFO MainThread:566578 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 34218496 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x148c6681ba50>>
|
| 29 |
+
2026-08-03 01:06:27,412 INFO MainThread:566578 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 34218496 None
|